Skip to main content
QUICK REVIEW

[논문 리뷰] A Fully Differentiable Beam Search Decoder

Ronan Collobert, Awni Hannun|arXiv (Cornell University)|2019. 02. 16.
Speech Recognition and Synthesis참고 문헌 37인용 수 15
한 줄 요약

이 논문은 액스트릭 모델과 언어 모델의 엔드 투 엔드 훈련을 가능하게 하기 위해 비드 빔 서치 과정을 통해 기울기 역전파를 허용하는 완전히 미분 가능한 빔 서치 디코더(DBD)를 소개한다. 이는 노출 편향과 레이블 편향을 제거한다. 이 방법은 비정규화 점수를 공동 최적화하고 시퀀스 수준 정규화를 사용함으로써 더 작은 빔 크기와 간단한 모델로도 WSJ 데이터셋에서 최신 기술 수준의 WER를 달성한다.

ABSTRACT

We introduce a new beam search decoder that is fully differentiable, making it possible to optimize at training time through the inference procedure. Our decoder allows us to combine models which operate at different granularities (e.g. acoustic and language models). It can be used when target sequences are not aligned to input sequences by considering all possible alignments between the two. We demonstrate our approach scales by applying it to speech recognition, jointly training acoustic and word-level language models. The system is end-to-end, with gradients flowing through the whole architecture from the word-level transcriptions. Recent research efforts have shown that deep neural networks with attention-based mechanisms are powerful enough to successfully train an acoustic model from the final transcription, while implicitly learning a language model. Instead, we show that it is possible to discriminatively train an acoustic model jointly with an explicit and possibly pre-trained language model.

연구 동기 및 목표

  • 훈련 중 빔 서치를 통해 기울기 흐름을 가능하게 하여 시퀀스 모델링에서의 노출 편향을 제거하기 위해.
  • 국소적으로 정규화된 모델에서의 레이블 편향을 제거하기 위해 비정규화 점수와 글로벌 시퀀스 수준 정규화를 사용하기 위해.
  • 예를 들어 토큰 수준과 단어 수준에서 작동하는 모델을 별도의 초모수 튜닝 없이 공동 훈련할 수 있도록 하기 위해.
  • 비용이 많이 드는 정규화 항을 피하여 긴 시퀀스와 큰 어휘집에 대해 효율적으로 스케일링할 수 있도록 하기 위해.
  • 간단하고 작은 액스트릭 모델이 미분 가능한 빔 서치로 훈련될 경우 경쟁 가능한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 디코더는 액스트릭 모델의 비정규화 프레임 점수와 토큰 수준 및 단어 수준 언어 모델의 비정규화 전이 점수를 사용한다.
  • 목표 시퀀스 추적 메커니즘을 도입한 새로운 방식의 빔 서치를 수행하여 서치 과정 동안 기울기를 유지한다.
  • 목표 시퀀스에 대한 모든 유효한 정렬에 대해 글로벌 정규화 항을 계산함으로써 국소 정규화와 레이블 편향을 피한다.
  • 비드 빔 서치를 근사하기 위해 기울기 역전파가 가능한 log-sum-exp(logadd) 연산을 사용하여 n-best 후보들에 대해 기울기 역전파를 가능하게 한다.
  • 다양한 정밀도 수준에서 작동하는 모델(예: 사전 훈련된 언어 모델 포함)의 임의의 조합을 지원한다.
  • 전체 아키텍처, 빔 서치 포함 기울기가 역전파를 통해 계산되며, 엔드 투 엔드 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1비드 서치를 완전히 미분 가능하게 만들 수 있을까? 이를 통해 액스트릭 모델과 언어 모델의 엔드 투 엔드 훈련이 가능해지는가?
  • RQ2미분 가능한 비드 서치가 시퀀스 모델링에서의 노출 편향과 레이블 편향을 제거하는가?
  • RQ3예를 들어 단어 수준과 토큰 수준에서 작동하는 모델의 공동 훈련이 초모수 튜닝 없이 가능할까?
  • RQ4비용이 많이 드는 정규화 항을 피하기 때문에 이 방법이 큰 어휘집과 긴 시퀀스에 대해 효율적으로 스케일링되는가?
  • RQ5간단하고 작은 액스트릭 모델이 미분 가능한 비드 서치로 훈련될 경우 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • DBD는 WSJ 데이터셋에서 최신 기술 수준의 단어 오류률(WER)을 달성하며, 단순히 전사본과 음성 데이터만 사용하는 최신 기술 모델과 유사한 성능을 보인다.
  • 빔 크기가 500일 때도 WER를 감소시켜, 빔 크기가 8000이 필요한 잘 튜닝된 ASG 기반 모델을 초월한다.
  • 시간적 수신 영역가 반으로 줄이고 파rameter 수가 적은 더 단순한 액스트릭 모델도 DBD로 훈련될 경우 동일한 성능을 달성한다.
  • 검증 세트에서 디코딩 파라미터(예: 언어 모델 가중치)의 초모수 튜닝이 더 이상 필요 없어진다.
  • DBD로 훈련하면 액스트릭 모델이 유효한 단어 시퀀스에 집중할 수 있어 암묵적인 언어 모델링 학습의 부담이 줄어든다.
  • 빔 크기가 500일 때 WSJ 데이터셋에서 전체 훈련 에포크가 약 30분 내로 완료되어 확장성과 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.