Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end attention-based distant speech recognition with Highway LSTM

Hassan Taherian|arXiv (Cornell University)|2016. 10. 17.
Speech Recognition and Synthesis참고 문헌 12인용 수 3
한 줄 요약

이 논문은 다중채널 오디오 입력과 하이웨이 장기 단기 기억(HLSTM) 네트워크를 사용하여 원거리 음성 인식을 위한 엔드 투 엔드 주의 기반 음성 인식 시스템을 제안한다. 주의 메커니즘과 언어 모델링을 위한 가중 유한 상태 트ansducer(WFST)를 통합함으로써, AMI 원거리 음성 인식 벤치마크에서 이전 방법들을 능가하는 더 높은 강인성과 성능을 달성한다. 깊이 있는, 기울기 소실에 강건한 네트워크를 통해 성능 향상을 이룬다.

ABSTRACT

End-to-end attention-based models have been shown to be competitive alternatives to conventional DNN-HMM models in the Speech Recognition Systems. In this paper, we extend existing end-to-end attention-based models that can be applied for Distant Speech Recognition (DSR) task. Specifically, we propose an end-to-end attention-based speech recognizer with multichannel input that performs sequence prediction directly at the character level. To gain a better performance, we also incorporate Highway long short-term memory (HLSTM) which outperforms previous models on AMI distant speech recognition task.

연구 동기 및 목표

  • 반사와 겹침 신호로 인해 성능이 떨어지는 원거리 음성 인식(DSR)에 특화된 엔드 투 엔드 음성 인식 시스템을 개발하는 것.
  • 기존의 주의 기반 순환 시퀀스 생성기(ARSG)를 다중채널 오디오 입력을 직접 처리할 수 있도록 확장하여, 비스듬한 방식의 전처리(예: 빔포밍)에 의존하지 않도록 하는 것.
  • 스택드 RNN에서 기울기 소실 문제를 완화하기 위해 하이웨이 LSTM(HLSTM)을 통합하여 모델의 깊이와 학습 안정성을 향상시키는 것.
  • 학습의 타당성을 해치지 않으면서 ARSG 디코더에 WFST 프레임워크를 통해 언어 모델을 통합하여 단어 오류률(WER)을 감소시키는 것.

제안 방법

  • 모델은 N개의 오디오 스트림으로 구성된 다중채널 입력 X를 사용하며, 이를 연결하여 양방향 하이웨이 LSTM(BHLSTM) 인코더에 입력하여 깊은 문맥 표현을 학습한다.
  • 주의 메커니즘은 쿼리, 키, 컨텍스트 벡터를 사용하는 컨텍스트 기반 스코어링 함수를 통해 디코더 상태와 인코더 은닉 상태 hi 간의 정렬 가중치 αi,l을 계산한다.
  • 컨텍스트 벡터 ci는 주의 가중치 αi,l을 사용하여 인코더 상태의 가중합으로 계산되며, 관련된 입력 프레임에 집중한다.
  • 디코더는 이전 문자, 디코더 은닉 상태, 그리고 컨텍스트 벡터에 조건부로 출력 문자를 한 개씩 생성하는 단방향 LSTM이다.
  • WFST 프레임워크를 사용하여 디코딩 과정에 언어 모델을 통합하며, 조정 가능한 초기화 파rameter β를 사용하여 음성 모델 점수와 언어 모델 점수를 가중합으로 조합한다.
  • 전체 모델은 진짜 전사본의 로그우도를 최대화함으로써 엔드 투 엔드로 학습되며, 추론 중의 강인성을 향상시키기 위해 스케줄링 샘플링을 적용한다.

실험 결과

연구 질문

  • RQ1비스듬한 빔포밍이 없는 조건에서, 다중채널 입력을 사용하는 엔드 투 엔드 주의 기반 모델이 기존의 DNN-HMM 시스템을 능가할 수 있는가?
  • RQ2하이웨이 LSTM의 통합이 원거리 음성 인식을 위한 깊은 RNN 아키텍처에서 학습 안정성과 성능을 어떻게 향상시키는가?
  • RQ3WFST를 통해 언어 모델을 통합할 경우, 원거리 음성 인식을 위한 엔드 투 엔드 ASR에서 단어 오류률이 어느 정도 감소하는가?
  • RQ4채널별 주의를 사용해 별도로 채널을 처리하는 것과 비교해, 인코딩 전에 다중채널 입력을 연결하는 것이 더 높은 성능을 낼 수 있는가?
  • RQ5노이즈가 많고 반사가 심한 환경에서 주의 메커니즘은 다중채널에 걸쳐 관련된 입력 프레임에 효과적으로 집중할 수 있는가?

주요 결과

  • 다중채널 입력과 BHLSTM 인코더를 사용하는 제안된 엔드 투 엔드 모델은 기울기 소실 없이 더 깊은 네트워크를 활용함으로써, AMI 원거리 음성 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 하이웨이 LSTM의 사용은 깊은 RNN 아키텍처의 안정적인 학습을 가능하게 하여, 표준 LSTMs에 비해 인코더 내 표현 학습 능력을 향상시킨다.
  • WFST 프레임워크를 통해 언어 모델을 통합함으로써 단어 오류률(WER)이 크게 감소하며, 엔드 투 엔드 ASR에서 언어 모델링의 중요성을 입증한다.
  • 단일채널 입력에 의존하거나 기존의 DNN-HMM 시스템에 기반한 이전의 주의 기반 모델보다 성능이 뛰어나며, 특히 어려운 음향 조건에서 두각을 나타낸다.
  • 다중채널 입력, 주의 메커니즘, HLSTM의 통합은 마이크 어레이 기하학적 구조에 대한 사전 지식이 없이도 강인하고 실시간 추론을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.