AR 번역 앱과 음성 받아쓰기 서비스
2011년 초 아이폰 앱스토어에는 '언어'라는 오래된 문제를 새로운 입력 채널로 풀어낸 초기 사례들이 등장했다. Dragon Dictation은 발화를 그대로 재생하는 데 그치던 기존 음성 메모 앱과 달리, 음성을 곧바로 편집 가능한 텍스트로 변환해주는 음성인식 앱이었다. 스무고개 게임 서비스 Akinator가 집단지성으로 질문·응답의 정확도를 계속 끌어올리던 방식에 빗대어, 문장 단위로 사용자 피드백을 모아 인식 정확도를 보완하는 구조가 음성-텍스트 변환 서비스에도 적용될 수 있으리라는 전망이 제시됐다. 다만 비영어권 사용자에게는 받아쓰기 정확도보다, 당시 발음 교정 도구로 쓰이던 English Central처럼 어학 학습 보조 수단으로서의 활용이 더 현실적이라는 점도 함께 언급됐다.
같은 글에서 소개된 Word Lens는 스마트폰 카메라가 비추는 실시간 영상 속 문자를 인식해, 번역된 텍스트를 원래 문자가 있던 자리에 그대로 겹쳐 보여주는 AR(증강현실) 기반 시각 번역 앱이었다. 시연 영상만큼 매끄럽게 동작하지는 않았지만, 이런 기술이 다른 AR 서비스와 결합된다면 낯선 해외에서도 익숙한 국내처럼 돌아다닐 수 있는 편리함으로 이어질 것이라는 기대가 제시됐다. 실시간 영상 위에 텍스트를 자연스럽게 겹쳐 보이도록 만드는 마스킹(masking) 기술 자체도 번역 외에 다양한 용도로 응용될 수 있으리라는 전망이 함께 언급됐다.
두 서비스는 '언어'라는 같은 문제를 서로 다른 입력 채널(음성 vs 카메라 영상)로 풀어낸 사례로, 완성도는 초기 단계에 머물러 있었지만 이후 음성 인식·AR 인터페이스가 어떤 방향으로 발전할지 가늠하게 하는 2011년 시점의 초기 레퍼런스에 해당한다.
핵심 내용
- Dragon Dictation: 음성을 편집 가능한 텍스트로 변환하는 음성인식 앱, Akinator식 집단지성 기반 정확도 개선 가능성과 비영어권 사용자의 발음 교정 도구 활용법을 함께 제시
- Word Lens: 카메라 영상 속 문자를 실시간으로 인식해 번역 텍스트를 원위치에 매핑하는 AR 기반 시각 번역 앱
- 두 서비스 모두 실제 완성도는 시연 영상에 못 미쳤지만, 텍스트-음성 변환과 실시간 시각 매핑(마스킹) 기술이 이후 다양한 서비스로 확장될 잠재력을 짚어본 초기 사례
관련 개념
- Natural User Interface NUI — 음성 인식 등 자연스러운 입력 방식을 다루는 더 넓은 기술 틀
- 버튼 인풋과 음성 인풋 비교 — 음성이라는 입력 채널이 갖는 구조적 특성을 후속적으로 정리한 논의
- 음성 에이전트와 VUI — 음성인식 기술이 이후 대화형 에이전트로 발전한 사례
출처
- 언어에 관련하여 몇 가지 흥미로운 서비스 소개 — 2011-01-14, 알 수 없는 사용자