Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Completion Distillation for Sequence Learning

Sara Sabour, William Chan|arXiv (Cornell University)|2018. 10. 02.
Natural Language Processing Techniques참고 문헌 67인용 수 5
한 줄 요약

이 논문은 순서 기반 모델의 훈련을 위한 새로운 방법인 최적 완성 정련(Optimal Completion Distillation, OCD)을 소개한다. 이 방법은 동적 프로그래밍을 사용해 생성된 접두사에 대한 최적의 접미사를 식별함으로써 편집 거리 기반 최적화를 수행한다. OCD는 언어 모델 리스크로링 없이도 엔드 투 엔드 음성 인식에서 최고 성능을 기록하며, 월스트리트저널(Wall Street Journal)에서 9.3%의 WER, Librispeech test-clean에서 4.5%의 WER를 달성하여 MLE 및 이전 방법들을 능가한다. 추가 하이퍼파라미터 없이도 성능을 내는 데 성공했다.

ABSTRACT

We present Optimal Completion Distillation (OCD), a training procedure for optimizing sequence to sequence models based on edit distance. OCD is efficient, has no hyper-parameters of its own, and does not require pretraining or joint optimization with conditional log-likelihood. Given a partial sequence generated by the model, we first identify the set of optimal suffixes that minimize the total edit distance, using an efficient dynamic programming algorithm. Then, for each position of the generated sequence, we use a target distribution that puts equal probability on the first token of all the optimal suffixes. OCD achieves the state-of-the-art performance on end-to-end speech recognition, on both Wall Street Journal and Librispeech datasets, achieving $9.3\%$ WER and $4.5\%$ WER respectively.

연구 동기 및 목표

  • 최대가능도 추정(MLE)에 의존하지 않고 편집 거리 기반으로 직접 최적화하는 순서 기반 모델 훈련 절차를 개발하는 것.
  • 하이퍼파라미터 조정, 사전 훈련, 또는 조건부 로그가능도와의 동시 최적화가 필요 없도록 하는 것.
  • 모델이 참조 시퀀스와의 편집 거리를 최소화하도록 학습시켜 엔드 투 엔드 음성 인식 성능을 향상시키는 것.
  • 기존 순서 최적화 방법의 대안으로서 확장 가능하고 효율적이며 하이퍼파라미터가 없는 대체 방법을 제공하는 것.

제안 방법

  • 모델이 생성한 각 접두사에 대해 OCD는 동적 프로그래밍을 사용해 참조 시퀀스와의 총 편집 거리를 최소화하는 모든 최적의 접미사를 계산한다.
  • 각 최적 접미사의 첫 번째 토큰에 동일한 확률을 할당하는 타겟 분포를 정의함으로써 최적의 완성 정책을 정련한다.
  • 모델은 이러한 첫 번째 토큰들의 평균 로그 확률을 최대화하도록 훈련되며, 이는 접두사를 최적으로 연장하는 것을 효과적으로 학습하는 데 기여한다.
  • 이 방법은 온라인 방식으로 작동하며, 훈련 중인 모델에서 샘플링된 온-폴리시 트레이젝터리를 사용한다.
  • 길이가 n인 생성된 시퀀스와 길이가 m인 참조 시퀀스에 대해 O(nm) 시간에 작동하므로 장거리 시퀀스에 대해서도 효율적이다.
  • MLE 초기화를 피하고 조건부 로그가능도와의 동시 최적화가 필요 없어 독립적인 훈련이 가능하다.

실험 결과

연구 질문

  • RQ1MLE나 보조 목표에 의존하지 않고 편집 거리를 직접 최소화하도록 순서 기반 모델을 훈련시킬 수 있는가?
  • RQ2동적 프로그래밍을 사용해 생성된 접두사에 대해 최적의 완성 접미사를 효율적으로 계산할 수 있는가?
  • RQ3최적의 완성 정책을 정련하는 것이 MLE나 단일 목표 최적화보다 성능을 향상시키는가?
  • RQ4OCD는 언어 모델 리스크로링 없이도 엔드 투 엔드 음성 인식에서 최고 성능을 달성할 수 있는가?

주요 결과

  • OCD는 월스트리트저널 데이터셋에서 9.3%의 WER를 기록하여 모든 이전 작업을 능가하며, MLE 기준 12%의 상대적 향상도를 보였다.
  • Librispeech test-clean에서 OCD는 4.5%의 WER를 기록하여 MLE 기준 21%의 상대적 향상도를 보였으며, 새로운 최고 성능 기록을 수립했다.
  • 더 도전적인 Librispeech test-other 세트에서는 OCD가 13.3%의 WER를 기록하여 Zeyer 등(2018)의 이전 최고 성능인 15.4%를 능가했다.
  • WSJ에서 OCD는 3.1%의 CER를 기록하여 MLE 기준 14%의 상대적 향상도를 보였다.
  • 단일 최적 완성(예: OCT)을 선택하는 것과 같은 대안 전략보다 OCD가 전체 최적 완성 집합을 고려함으로써 성능 향상의 이점을 입증했다.
  • 알고리즘은 효율적이고 확장 가능하며 추가 하이퍼파라미터가 없으며, 초기 훈련 에포크부터 MLE를 능가하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.