Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging End-to-End Speech Recognition with Neural Architecture Search

Ahmed Baruwa, Mojeed Abisiga|arXiv (Cornell University)|2019. 12. 11.
Speech Recognition and Synthesis참고 문헌 39인용 수 8
한 줄 요약

이 논문은 최소한의 계산 비용으로 최적화된 DNN 아키텍처를 발견함으로써 엔드 투 엔드 음성 인식을 가속화하는 신경망 아키텍처 탐색(NAS) 프레임워크를 제안한다. 이는 몇 시간 내에 LibriSpeech에서 7% WER, TIMIT에서 13% PER를 달성하여, 높은 정확도를 유지하면서도 기존의 어텐션 기반 seq2seq 모델보다 훨씬 빠른 학습 속도를 보인다.

ABSTRACT

Deep neural networks (DNNs) have been demonstrated to outperform many traditional machine learning algorithms in Automatic Speech Recognition (ASR). In this paper, we show that a large improvement in the accuracy of deep speech models can be achieved with effective Neural Architecture Optimization at a very low computational cost. Phone recognition tests with the popular LibriSpeech and TIMIT benchmarks proved this fact by displaying the ability to discover and train novel candidate models within a few hours (less than a day) many times faster than the attention-based seq2seq models. Our method achieves test error of 7% Word Error Rate (WER) on the LibriSpeech corpus and 13% Phone Error Rate (PER) on the TIMIT corpus, on par with state-of-the-art results.

연구 동기 및 목표

  • 효율적인 신경망 아키텍처 최적화를 통해 딥 스피치 모델의 정확도를 향상시키기.
  • 자동 음성 인식에서 최적의 신경망 아키텍처를 탐색하는 데 일반적으로 수반되는 계산 비용을 줄이기.
  • 기존의 어텐션 기반 seq2seq 접근 방식에 비해 모델 탐색과 학습을 가속화하기.
  • 가벼운 탐색 프로세스를 사용하여 LibriSpeech와 TIMIT와 같은 표준 벤치마크에서 최신 기술 수준의 성능을 달성하기.

제안 방법

  • 이 방법은 엔드 투 엔드 음성 인식을 위한 고성능 신경망 아키텍처를 자동으로 발견하기 위해 신경망 아키텍처 탐색(NAS)을 활용한다.
  • 수동으로 설계된 또는 어텐션 기반 모델에 의존하는 것이 아니라, DNN의 아키텍처 최적화에 집중한다.
  • 탐색 프로세스는 계산적으로 효율적으로 설계되어 하루가 채 안 되는 시간 내에 후보 모델을 발견할 수 있도록 한다.
  • 프레임워크는 표준 벤치마크인 LibriSpeech와 TIMIT에서 발견된 모델을 훈련하고 평가한다.
  • 컨볼루션 레이어, 리스크 커넥션, 활성화 함수와 같은 다양한 아키텍처 구성 요소를 포함하는 탐색 공간을 활용한다.
  • 최종 모델는 표준 평가 지표인 단어 오류률(WER)과 음소 오류률(PER)을 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1신경망 아키텍처 탐색은 낮은 계산 부담으로 엔드 투 엔드 음성 인식 모델의 정확도를 크게 향상시킬 수 있는가?
  • RQ2표준 ASR 벤치마크에서 어텐션 기반 seq2seq 모델에 비해 NAS 기반의 모델 탐색은 속도와 성능 면에서 어떻게 비교되는가?
  • RQ3LibriSpeech와 TIMIT에서 NAS 최적화된 DNN을 사용할 경우 도달할 수 있는 WER 및 PER 수준은 어느 정도인가?
  • RQ4정확도를 희생시키지 않고 몇 시간 내에 효과적인 신경망 아키텍처 최적화를 달성할 수 있는가?
  • RQ5NAS는 기존 최신 기술 수준의 모델을 초월하는 새로운 아키텍처를 발견하는 데 도움이 되는가?

주요 결과

  • 제안된 NAS 프레임워크는 LibriSpeech 코퍼스에서 테스트 단어 오류률(WER) 7%를 달성하여 최신 기술 수준의 성능을 보였다.
  • TIMIT 코퍼스에서는 13%의 음소 오류률(PER)을 달성하여 최고로 보고된 결과와 수준을 같이했다.
  • 모델 탐색 및 학습 프로세스는 하루가 채 안 되는 시간에 완료되어 어텐션 기반 seq2seq 모델보다 훨씬 빠른 속도를 보였다.
  • 이 방법은 낮은 계산 비용으로도 효과적인 신경망 아키텍처 최적화를 수행할 수 있음을 입증했다.
  • NAS 최적화된 모델는 전통적인 DNN보다 뛰어난 성능을 보였고, 학습 속도 면에서 어텐션 기반 모델와도 맞먹거나 초월했다.
  • 결과적으로 NAS는 고성능 음성 인식 아키텍처를 발견하는 데 실현 가능하고 효율적인 접근법임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.