Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Regularization Techniques for End-to-End Speech Recognition

Yingbo Zhou, Caiming Xiong|arXiv (Cornell University)|2017. 12. 19.
Speech Recognition and Synthesis참고 문헌 18인용 수 12
한 줄 요약

이 논문은 엔드 투 엔드 음성 인식 모델을 위한 향상된 정규화 기법—특히 독립적인 템포 및 테너프 조정, 노이즈 주입, 다층 드롭아웃—을 제안한다. 이러한 방법들을 조합함으로써 저자들은 WSJ 및 LibriSpeech 데이터셋에서 각각 20% 이상의 상대적 WER 감소를 달성하였으며, WSJ에서 6.26% WER, LibriSpeech test-clean에서 5.67% WER로 새로운 최고 성능 기록을 수립하였다.

ABSTRACT

Regularization is important for end-to-end speech models, since the models are highly flexible and easy to overfit. Data augmentation and dropout has been important for improving end-to-end models in other domains. However, they are relatively under explored for end-to-end speech models. Therefore, we investigate the effectiveness of both methods for end-to-end trainable, deep speech recognition models. We augment audio data through random perturbations of tempo, pitch, volume, temporal alignment, and adding random noise.We further investigate the effect of dropout when applied to the inputs of all layers of the network. We show that the combination of data augmentation and dropout give a relative performance improvement on both Wall Street Journal (WSJ) and LibriSpeech dataset of over 20%. Our model performance is also competitive with other end-to-end speech models on both datasets.

연구 동기 및 목표

  • 높은 유연성을 지닌 엔드 투 엔드 음성 모델에서 과적합을 줄이기 위한 데이터 증강 및 드롭아웃의 효과를 조사하는 것.
  • 기존의 속도 변형을 넘어서 데이터 다양성을 높이기 위해 오디오 데이터 증강에서 템포와 테너프를 독립적으로 제어하는 방법을 탐색하는 것.
  • 엔드 투 엔드 음성 인식에서 출력층 뿐 아니라 모든 네트워크 레이어에 드롭아웃을 적용할 경우의 영향을 평가하는 것.
  • 데이터 증강과 드롭아웃을 조합함으로써 표준 벤치마크에서 최고 성능을 달성할 수 있음을 보여주는 것.

제안 방법

  • SoX 오디오 툴을 사용하여 원시 오디오 수준의 데이터 증강을 적용하여 템포, 테너프, 볼륨, 시간적 정렬을 독립적으로 변형시켰다.
  • 무작위 백색 노이즈 주입 및 게인 조정을 통해 훈련 오디오의 노이즈가 포함된 변형을 생성했다.
  • 레이어별 비율을 적용한 드롭아웃을 구현: 입력 레이어는 0.1, 컨볼루션 레이어는 0.2, 순환 및 완전 연결 레이어는 0.3.
  • 학습 효율성 향상과 기울기 흐름 개선을 위해 디프스와이즈 분리형 컨볼루션과 잔여 블록(ResNet 스타일)을 사용했다.
  • 모든 레이어에 배치 정규화를 적용하고, 순차적 모델링을 위해 4층의 양방향 GRU를 사용했다.
  • 가중치 감쇠를 사용하여 모델을 훈련하고, 추론 시에는 4-그램 언어 모델과 함께 빔 서치 디코딩을 사용했다.

실험 결과

연구 질문

  • RQ1원시 오디오에서 템포와 테너프를 독립적으로 변형하는 것이 기존의 속도 변형보다 더 나은 일반화를 이끌어내는가?
  • RQ2엔드 투 엔드 음성 모델의 모든 입력 레이어에 드롭아웃을 적용하면 과적합을 크게 줄이고 성능을 향상시킬 수 있는가?
  • RQ3데이터 증강과 드롭아웃의 조합이 엔드 투 엔드 음성 인식에서 단어 오류율(WER)에 미치는 영향은 무엇인가?
  • RQ4이러한 정규화 기법들은 WSJ 및 LibriSpeech와 같은 표준 벤치마크에서 이전의 최고 성능 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • WSJ 데이터셋에서 데이터 증강과 드롭아웃의 조합으로 인해 단어 오류율이 베이스라인 8.38%에서 6.42%로 감소하여 상대적 향상률이 23.39%에 달했다.
  • LibriSpeech test-clean에서 최종 모델은 5.67% WER를 기록했으며, 베이스라인 7.45% 대비 23.89% 상대적 향상률을 달성했다.
  • LibriSpeech test-other에서 모델은 15.18% WER를 기록했으며, 베이스라인 22.59% 대비 32.80% 상대적 향상률을 기록했다.
  • 표준 훈련 세트만을 사용함에도 불구하고, Amodei 등 [9]의 최고 성능 방법과 경쟁 가능한 성능을 달성했다.
  • 훈련 곡선을 분석한 결과, 정규화 기법이 훈련 손실과 검증 손실 간 격차를 좁혀 더 나은 일반화를 이끌어냈다.
  • 제거 분석 결과, 데이터 증강과 드롭아웃 각각이 유의미한 기여를 하였으며, 함께 사용했을 때 가장 높은 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.