Skip to main content
QUICK REVIEW

[논문 리뷰] The History of Speech Recognition to the Year 2030

Awni Hannun|arXiv (Cornell University)|2021. 07. 30.
Speech Recognition and Synthesis참고 문헌 27인용 수 16
한 줄 요약

이 논문은 2020년에서 2030년 사이의 음성 인식 기술 발전을 예측하며, 단어 오류율 향상 속도가 둔화될 것으로 보이나, 현장 내 개인화, 엣지 추론, 희소성, 더 rich한 출력 표현 방식에서의 중대한 발전이 나타날 것으로 전망한다. 저자는 개인화와 맥락 인식 모델링이 강력하고 일반적인 음성 인식 기술의 잔여 장벽을 극복하는 데 핵심이 될 것이라고 강조한다.

ABSTRACT

The decade from 2010 to 2020 saw remarkable improvements in automatic speech recognition. Many people now use speech recognition on a daily basis, for example to perform voice search queries, send text messages, and interact with voice assistants like Amazon Alexa and Siri by Apple. Before 2010 most people rarely used speech recognition. Given the remarkable changes in the state of speech recognition over the previous decade, what can we expect over the coming decade? I attempt to forecast the state of speech recognition research and applications by the year 2030. While the changes to general speech recognition accuracy will not be as dramatic as in the previous decade, I suggest we have an exciting decade of progress in speech technology ahead of us.

연구 동기 및 목표

  • 2020년에서 2030년 사이 자동 음성 인식(ASR) 연구 및 응용의 발전 방향을 예측하는 것.
  • 다음 10년간 음성 기술을 규정할 핵심 연구 및 기술적 전환을 특정하는 것.
  • 정확도 향상 외에도 개인화, 현장 내 학습, 맥락 기반 모델링이 어떻게 발전을 이끄는지 탐구하는 것.
  • 현재 벤치마크의 한계를 평가하고 인간이 참여하는 투입 시스템의 미래 역할을 분석하는 것.
  • 음성 보조자에서의 제약 요소를 평가하고 언어 이해가 향후 개발에서 어떤 역할을 할 것인지 평가하는 것.

제안 방법

  • 2010–2020년 기간의 역사적 추세—특히 딥러닝, 대규모 데이터셋, GPU 가속 기술—을 기반으로 예측을 수립한다.
  • 리처드 함밍의 예측 방법론에서 영감을 얻어, 실천, 근본적 이해, 개방적인 사고 방식의 중요성을 강조한다.
  • 향후 발전은 단어 오류율 향상에 의존하는 것보다 맥락 기반 모델링, 개인화, 효율적인 현장 내 추론에 더 의존할 것이라 제안한다.
  • 희소성과 경량 모델 아키텍처가 현장 내 학습 및 추론을 가능하게 하는 핵심 요소로 나타날 것임을 식별한다.
  • 다음 작업을 지원하기 위해 그래프 기반의 더 rich한 출력 표현 방식을 위한 모델 출력을 권장한다.
  • 예를 들어 LibriSpeech와 같은 벤치마크의 실증적 증거(예: 단어 오류율이 인간 수준 이하)와 사례 연구(예: 연락처 목록 개인화가 재현율을 2.4%에서 73.5%로 향상시킴)에 기반한다.

실험 결과

연구 질문

  • RQ12020년에서 2030년 사이 음성 인식 분야에서 지배적인 연구 및 응용 추세는 무엇이 될 것인가?
  • RQ2개인화와 맥락 통합이 음성 인식 성능과 사용성에 어떻게 영향을 미칠 것인가?
  • RQ3현장 내 학습과 희소성이 효율적이고, 비밀이 보장되며, 적응 가능한 음성 시스템을 가능하게 하는 데 어떤 역할을 할 것인가?
  • RQ4왜 2030년에는 표준 벤치마크에서 단어 오류율 향상이 연구 목표로서 덜 중요한 역할을 하게 될 것인가?
  • RQ5음성 보조자가 현재의 능력을 초월해 어떻게 진화할 수 있을까? 그 개발에서 핵심적인 제약 요소는 무엇인가?

주요 결과

  • 2030년까지 대부분의 음성 인식 추론이 엣지에서 이루어지며, 클라우드 기반 처리에 대한 의존도가 감소할 것이다.
  • 경량 모델과 약한 지도 학습에 힘입어 현장 내 모델 학습이 크게 보편화될 것이다.
  • 희소성은 효율적인 현장 내 추론 및 학습을 가능하게 하기 위한 핵심 연구 분야로 부상할 것이다.
  • 단순하고 고립된 문장에서의 모델이 베이즈 오류율에 도달함에 따라, 표준 벤치마크에서 단어 오류율 향상은 연구 목표로서 상실할 것이다.
  • 대화 및 이해와 같은 후행 작업을 지원하기 위해 음성 인식자가 점점 더 구조적이고 그래프 기반의 표현 방식을 출력할 것이다.
  • 개인화된 모델은 일반화될 것이며, 표현이 어려운 집단과 언어 장애를 가진 사람들에 대한 인식 성능 향상이 뚜렷이 나타날 것이다. 예를 들어, 언어 장애가 있는 사용자에게서 개인화로 64%의 상대적 WER 감소가 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.