Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-based Wav2Text with Feature Transfer Learning

Andros Tjandra, Sakriani Sakti|arXiv (Cornell University)|2017. 09. 22.
Speech Recognition and Synthesis참고 문헌 21인용 수 10
한 줄 요약

이 논문은 스펙트럼 특징 없이 원시 음성 웨이브포맷을 직접 텍스트로 변환하는 최초의 엔드 투 엔드 주의 기반 인코더-디코더 모델인 Attention-based Wav2Text를 제안한다. 특징 전이 학습을 통해 멜-스펙트로그램 특징으로 훈련된 모델의 가중치로 인코더를 초기화함으로써, 우수한 수렴성과 성능을 달성하였으며, 원시 웨이브포맷 기반 베이스라인 및 표준 필터뱅크 특징으로 훈련된 모델들을 능가하여 WSJ-SI284에서 6.54%의 CER을 기록하였다.

ABSTRACT

Conventional automatic speech recognition (ASR) typically performs multi-level pattern recognition tasks that map the acoustic speech waveform into a hierarchy of speech units. But, it is widely known that information loss in the earlier stage can propagate through the later stages. After the resurgence of deep learning, interest has emerged in the possibility of developing a purely end-to-end ASR system from the raw waveform to the transcription without any predefined alignments and hand-engineered models. However, the successful attempts in end-to-end architecture still used spectral-based features, while the successful attempts in using raw waveform were still based on the hybrid deep neural network - Hidden Markov model (DNN-HMM) framework. In this paper, we construct the first end-to-end attention-based encoder-decoder model to process directly from raw speech waveform to the text transcription. We called the model as "Attention-based Wav2Text". To assist the training process of the end-to-end model, we propose to utilize a feature transfer learning. Experimental results also reveal that the proposed Attention-based Wav2Text model directly with raw waveform could achieve a better result in comparison with the attentional encoder-decoder model trained on standard front-end filterbank features.

연구 동기 및 목표

  • 수작업 특징이나 하이브리드 프레임워크 없이 원시 음성 웨이브포맷을 직접 텍스트 변환으로 매핑하는 엔드 투 엔드 자동 음성 인식 시스템을 개발하는 것.
  • 고차원적이고 저수준의 입력으로 인해 종종 수렴하지 못하는 깊이 있는 주의 기반 인코더-디코더 모델을 원시 웨이브포맷에서 훈련하는 데 도전하는 것.
  • 스펙트럼 기반 모델에서 전이 학습을 통해 원시 웨이브포맷 ASR에서 훈련의 안정성과 성능을 향상시킬 수 있는지 조사하는 것.
  • 표준 ASR 데이터셋인 WSJ-SI84 및 WSJ-SI284를 사용하여 제안된 Attention-based Wav2Text 모델을 기존 기준 모델과 비교 평가하는 것.

제안 방법

  • 원시 음성 웨이브포맷을 직접 처리하는 엔드 투 엔드 주의 기반 인코더-디코더 아키텍처를 제안하며, 기존의 MFCC나 필터뱅크와 같은 특징 추출기 대체함.
  • 특징 전이 학습 전략을 도입: 인코더를 멜-스펙트로그램 특징으로 사전 훈련하여 의미 있는 표현을 학습한 후, 원시 웨이브포맷에서의 미세조정 수행.
  • 원시 음성 내 장거리 의존성을 모델링하기 위해 컨볼루션 레이어, NIN(Network-in-Network) 블록, 양방향 LSTM을 조합한 하이브리드 인코더 구조 사용.
  • 현재 디코더 은닉 상태와 인코더 출력을 기반으로 컨텍스트 벡터를 계산하는 주의 메커니즘을 적용하여 입력과 출력 시퀀스 간의 동적 정렬 가능.
  • 자기 회귀적 생성을 향상시키기 위해 이전 컨텍스트 벡터를 현재 입력 임베딩과 연결하여 입력 피드백을 적용.
  • 정답 텍스트 변환과 함께 교차 엔트로피 손실을 사용하여 전체 모델을 엔드 투 엔드로 훈련하며, 최적화의 안정성을 높이기 위해 전이된 인코더 가중치 활용.

실험 결과

연구 질문

  • RQ1스펙트럼 특징 없이 원시 음성 웨이브포맷에서 직접 훈련된 엔드 투 엔드 주의 기반 인코더-디코더 모델이 경쟁력 있는 ASR 성능을 달성할 수 있는가?
  • RQ2멜-스펙트로그램으로 사전 훈련된 모델에서 전이 학습을 통해 엔드 투 엔드 원시 웨이브포맷 ASR 시스템의 수렴성과 성능이 향상되는가?
  • RQ3제안된 Attention-based Wav2Text 모델의 성능은 필터뱅크나 MFCC 특징으로 훈련된 표준 모델과 비교해 어떻게 되는가?
  • RQ4다양한 전이 학습 전략(예: fbank, MFCC, 다중 목표)이 최종 ASR 정확도에 미치는 영향은 무엇인가?

주요 결과

  • 전이 학습 없이 제안된 Attention-based Wav2Text 모델은 수렴하지 못했으며, 원시 웨이브포맷에서 무작위 가중치로 초기화할 경우 훈련의 불안정성을 시사함.
  • 전이 학습을 적용한 결과, WSJ-SI284 데이터셋에서 6.54%의 문자 오류율(CER)을 기록하여, 필터뱅크 특징으로 훈련된 베이스라인 주의 모델(7.69% CER)을 능가함.
  • 다중 목표 사전 훈련 전략에서 전이 학습을 수행했을 때 가장 우수한 성능를 기록하여, 다중 작업 표현 학습이 특징 전이 효과를 향상시킴을 시사함.
  • MFCC 특징으로 사전 훈련한 전이 학습을 통해 6.58% CER를 기록하여 fbank 기반 전이 학습(6.78% CER)보다 略로 뛰어남. 이는 MFCC 기반 사전 훈련이 원시 웨이브포맷 미세조정에 더 효과적임을 시사함.
  • 결과적으로 특징 전이 학습은 원시 웨이브포맷에서 안정적이고 정확한 엔드 투 엔드 ASR 시스템을 훈련하기 위해 필수적이며, 표준 스펙트럼 특징 기반 모델과 경쟁하거나 이를 초월하는 수렴성과 성능을 가능하게 함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.