Skip to main content
QUICK REVIEW

[논문 리뷰] English Conversational Telephone Speech Recognition by Humans and Machines

George Saon, Gakuto Kurata|arXiv (Cornell University)|2017. 03. 06.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 심층 잔차망(ResNet), 양방향 LSTMs와 다중 특징 융합, 그리고 WaveNet 스타일의 컨볼루션과 문자 수준 LSTMs를 포함한 고급 언어 모델을 결합한 하이브리드 시스템을 사용하여 Hub5 2000 평가의 Switchboard/CallHome 서브셋에서 새로운 최고 성능(WER 5.5%/10.3%)을 달성한다. 또한 이전에 인간 수준 성능에 도달했다는 주장에 도전하여 인간 성능이 이전에 보고된 것보다 낮음을 입증(_SWITCHBOARD에서 WER 5.1%)하며, 향후 연구를 위한 더 높은 목표를 설정한다.

ABSTRACT

One of the most difficult speech recognition tasks is accurate recognition of human to human communication. Advances in deep learning over the last few years have produced major speech recognition improvements on the representative Switchboard conversational corpus. Word error rates that just a few years ago were 14% have dropped to 8.0%, then 6.6% and most recently 5.8%, and are now believed to be within striking range of human performance. This then raises two issues - what IS human performance, and how far down can we still drive speech recognition error rates? A recent paper by Microsoft suggests that we have already achieved human performance. In trying to verify this statement, we performed an independent set of human performance measurements on two conversational tasks and found that human performance may be considerably better than what was earlier reported, giving the community a significantly harder goal to achieve. We also report on our own efforts in this area, presenting a set of acoustic and language modeling techniques that lowered the word error rate of our own English conversational telephone LVCSR system to the level of 5.5%/10.3% on the Switchboard/CallHome subsets of the Hub5 2000 evaluation, which - at least at the writing of this paper - is a new performance milestone (albeit not at what we measure to be human performance!). On the acoustic side, we use a score fusion of three models: one LSTM with multiple feature inputs, a second LSTM trained with speaker-adversarial multi-task learning and a third residual net (ResNet) with 25 convolutional layers and time-dilated convolutions. On the language modeling side, we use word and character LSTMs and convolutional WaveNet-style language models.

연구 동기 및 목표

  • Hub5 2000 Switchboard 및 CallHome 테스트 세트에서 영어 대화형 통화 음성 인식 성능 향상.
  • 품질 관리 조건 하에 독립적인 인간 전사 실험을 수행하여 인간의 음성 인식 성능을 재평가.
  • 현재 자동 음성 인식(ASR) 시스템이 대화형 음성 작업에서 인간 수준의 성능에 도달하거나 이를 초월했는지 탐구.
  • 저자원 대화형 음성 인식 분야에서 최신 음향 모델링 및 언어 모델링 기법을 개발하고 통합하여 기술 수준을 한층 끌어올림.
  • 학습-테스트 데이터 겹침과 대화 스타일 차이(이상자 vs. 친구/가족)가 ASR 및 인간 성능에 미치는 영향 평가.

제안 방법

  • 시작-지연 컨볼루션을 갖춘 25층의 확장 ResNet, 다중 특징 입력을 가진 양방향 LSTM, 그리고 화자 대비 다중 과제 학습 LSTM을 조합한 하이브리드 음향 모델 사용.
  • Hub5 2000 테스트 세트에서 정확도와 내성 강화를 높이기 위해 세 종류의 독립적 음향 모델 점수 융합 적용.
  • 다양한 언어 모델 통합: 단어 수준 및 문자 수준 LSTMs, 잔차 연결이 있는 WaveNet 스타일의 컨볼루션 언어 모델.
  • 5개의 언어 모델(모델-M 및 워드-LSTM-MTL 포함)을 선형 보간하여 n-best 레이어 재평가를 수행해 전사 출력을 정밀화.
  • NIST sclite와의 일관성 있는 평가를 확보하기 위해 참조 및 시스템 출력에서 마침표, 비어휘 요소, 구두점 제거 필터링 규칙 적용.
  • 보류된 데이터를 사용해 초모수 및 학습률 조정; ADAM 최적화 및 계층별 학습률 조율을 위한 자기 안정화 기법 적용.

실험 결과

연구 질문

  • RQ1Hub5 2000 Switchboard 및 CallHome 테스트 세트에서 진정한 인간의 단어 오류율(WER)은 얼마이며, 이는 이전 추정치와 어떻게 비교되는가?
  • RQ2학습 데이터 겹침(예: 공유 화자)이 Switchboard 테스트 세트에서 ASR 성능을 과도하게 높이는 정도는 어느 정도이며, 이는 인간 수준 성능에 대한 인식에 어떤 영향을 미치는가?
  • RQ3특히 LSTMs와 WaveNet 스타일의 컨볼루션에 비해 다양한 언어 모델 아키텍처가 대화형 음성 인식에서 WER 감소에 기여하는 정도는 어떠한가?
  • RQ4잔차망, 확장 컨볼루션, 다중 과제 학습을 결합한 음향 모델링 기법이 저자원 대화형 음성에서 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ5Switchboard와 CallHome 간 대화 스타일의 차이를 고려할 때, 현재 ASR 성능이 진정으로 인간 수준 성능에 도달하거나 이를 초월하고 있는가?

주요 결과

  • 품질 검사를 거친 최고의 인간 전사자가 Switchboard 테스트 세트에서 WER 5.1%를 기록했으며, 이는 이전 연구에서 보고된 5.9%보다 유의미하게 낮고 인간 수준 성능 주장에 도전하는 결과이다.
  • CallHome 테스트 세트에서 인간 성능은 WER 6.8%로 측정되었으며, 이는 이전 문헌에서 보고된 11.3%보다 훨씬 높아 CallHome이 이전에 상정된 것보다 더 도전적인 과제임을 시사한다.
  • 제안된 ASR 시스템은 Switchboard에서 5.5%, CallHome에서 10.3%의 새로운 최고 성능(WER)을 달성하여 이전 시스템을 능가하고 새로운 기준을 설정하였다.
  • 5개의 언어 모델(워드-LSTM-MTL 및 컨볼루션 WaveNet 스타일 LM 포함)의 조합은 Switchboard에서 WER 5.5%, CallHome에서 WER 10.3%로 감소시켰으며, 특히 CallHome에서 다중 과제 학습의 기여가 가장 두드러졌다.
  • 25층의 잔차망(ResNet)과 확장 컨볼루션을 사용한 것은 이전의 VGG 기반 모델 대비 음향 모델링 성능을 향상시켰으며, 특히 장거리 의존성을 더 잘 포착하였다.
  • 참조 및 시스템 출력에서 마침표를 제거함으로써 일부 테스트 세트(예: DEV’04f)에서 WER가 향상되었으며, 이는 參照 전사본에서 문장 부호 사용 방식의 일관성 부족이 평가 및 모델 평가에 영향을 미칠 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.