Skip to main content
QUICK REVIEW

[논문 리뷰] Improving End-to-End Speech Recognition with Policy Learning

Yingbo Zhou, Caiming Xiong|arXiv (Cornell University)|2017. 12. 19.
Speech Recognition and Synthesis참고 문헌 24인용 수 7
한 줄 요약

이 논문은 엔드 투 엔드 음성 인식에서 단어 오류율(WER)을 직접 최적화하기 위해 최대우도(CTC)와 자기비판적시퀀스학습(SCST)를 통한 정책강화학습을 결합한 다목적 학습 방법을 제안한다. CTC 전용 학습 대비 상대적 성능을 4%에서 13% 향상시키며, 월스트리트저널(Wall Street Journal)에서 5.53% WER, Librispeech test-clean에서 5.42% WER를 달성한다.

ABSTRACT

Connectionist temporal classification (CTC) is widely used for maximum likelihood learning in end-to-end speech recognition models. However, there is usually a disparity between the negative maximum likelihood and the performance metric used in speech recognition, e.g., word error rate (WER). This results in a mismatch between the objective function and metric during training. We show that the above problem can be mitigated by jointly training with maximum likelihood and policy gradient. In particular, with policy learning we are able to directly optimize on the (otherwise non-differentiable) performance metric. We show that joint training improves relative performance by 4% to 13% for our end-to-end model as compared to the same model learned through maximum likelihood. The model achieves 5.53% WER on Wall Street Journal dataset, and 5.42% and 14.70% on Librispeech test-clean and test-other set, respectively.

연구 동기 및 목표

  • 엔드 투 엔드 음성 인식에서 학습에 사용되는 최대우도 목표함수와 실제 성능 지표인 WER 사이의 불일치를 해결한다.
  • WER와 같이 미분이 불가능한 지표를 최적화하는 데 어려움이 있는 문제를 강화학습 기법을 활용해 극복한다.
  • CTC와 정책강화학습을 융합한 효율적인 공동학습 전략을 개발하여 최종 인식 정확도를 향상시킨다.
  • 정책학습을 통한 WER 직접 최적화가 추가 학습 데이터가 없이도 일관된 성능 향상을 이끌어내는지 입증한다.

제안 방법

  • 엔드 투 엔드 ASR의 시퀀스 레이블링에 최대우도 목표함수로 연결주의 시간분류(CTC)를 사용한다.
  • 자기비판적시퀀스학습(SCST) 기반의 정책강화학습 목표함수를 도입하여, 모델의 자체 가설과 금수적 기준(reference) 간의 기대 보상 차이를 이용해 기울기를 추정한다.
  • CTC 손실과 SCST로부터 유도된 음의 기대 WER를 조합한 다목적 손실을 제안하여 공동 최적화를 가능하게 한다.
  • 정책기반 기울기 추정을 효율적으로 수행하기 위해 단일 샘플 근사법을 적용한 REINFORCE 알고리즘을 사용하여 계산 비용을 감소시킨다.
  • 효율적인 특징 추출을 위해 프론트엔드에 잔차 연결과 디프스와이즈 분리형 컨볼루션을 구현한다.
  • 스케줄드 샘플링과 커리큘럼 학습을 적용하여 학습이 진행됨에 따라 정책학습 가중치(λ)를 0.1에서 1.0으로 점진적으로 증가시킨다.
Fig. 1 : Model architecture of our end-to-end speech model. Different colored blocks represent different layers as shown on the right, the lightning symbol indicates dropout happens between the two layers.
Fig. 1 : Model architecture of our end-to-end speech model. Different colored blocks represent different layers as shown on the right, the lightning symbol indicates dropout happens between the two layers.

실험 결과

연구 질문

  • RQ1정책강화학습이 엔드 투 엔드 음성 인식에서 비가역적인 지표인 WER을 효과적으로 최적화할 수 있는가?
  • RQ2CTC와 정책강화학습을 공동으로 학습시키면 표준 CTC 학습 대비 WER에서 측정 가능한 향상이 이루어지는가?
  • RQ3정책기반 기울기 추정의 단일 샘플 근사법을 사용할 경우, 특히 학습 비용 측면에서 제안된 방법의 효율성은 어떠한가?
  • RQ4더 큰 데이터셋에서 학습할 경우 모델의 일반화 능력이 향상되는가, 그리고 정책학습이 이 일반화 능력을 강화하는가?

주요 결과

  • SCST를 통한 CTC와 정책강화학습의 공동학습은 CTC 전용 기반선 대비 WSJ eval92 세트에서 WER을 13.8% 상대적으로 감소시켰다.
  • Librispeech에서는 기반선 대비 4% 상대적 향상도를 달성하여, test-clean에서는 5.42% WER, test-other에서는 14.70% WER를 기록했다.
  • Wall Street Journal 데이터셋에서 모델은 5.53% WER을 달성하여, 추가 데이터 없이도 이전의 엔드 투 엔드 모델을 초월했다.
  • WSJ에서 편집학습된 Librispeech 모델이 WSJ에서 직접 학습된 모델보다 우수한 성능을 보였으며, 이는 정책학습에 의한 일반화 능력 향상의 증거이다.
  • 더 이상 추가 학습 데이터를 사용하지 않아도 Amodei 등 [6]의 최첨단 모델과 경쟁 가능한 성능을 달성했다.
  • 정책기반 기울기 추정에 단일 샘플 근사법을 사용한 결과, 효과적이고 효율적이었으며, 실용적인 공동학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.