Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-tuning on Clean Data for End-to-End Speech Translation: FBK @ IWSLT 2018

Mattia Antonino Di Gangi, Roberto Dessì|arXiv (Cornell University)|2018. 10. 16.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 IWSLT 2018 영어-독어 작업을 위한 FBK의 엔드 투 엔드 음성 번역 시스템을 제시하며, 정제된 훈련 데이터로 미세조정된 CNN-LSTM 시퀀스-투-시퀀스 모델을 활용한다. 강제 정렬과 프레임 대 문자 비율 기반의 이중 단계 데이터 정제를 적용하고, 가중치 정규화, 레이블 스무딩, 체크포인트 평균화, 앙상블 디코딩을 통해 시스템은 테스트 BLEU 점수 10.24를 기록했으며, 단일 모델은 9.70 BLEU를 달성했다.

ABSTRACT

This paper describes FBK's submission to the end-to-end English-German speech translation task at IWSLT 2018. Our system relies on a state-of-the-art model based on LSTMs and CNNs, where the CNNs are used to reduce the temporal dimension of the audio input, which is in general much higher than machine translation input. Our model was trained only on the audio-to-text parallel data released for the task, and fine-tuned on cleaned subsets of the original training corpus. The addition of weight normalization and label smoothing improved the baseline system by 1.0 BLEU point on our validation set. The final submission also featured checkpoint averaging within a training run and ensemble decoding of models trained during multiple runs. On test data, our best single model obtained a BLEU score of 9.7, while the ensemble obtained a BLEU score of 10.24.

연구 동기 및 목표

  • 공식 IWSLT 2018 훈련 데이터만을 사용하여 엔드 투 엔드 영어-독어 음성 번역 성능을 향상시키기 위해.
  • 저품질 음성-번역 쌍을 식별하고 제거하여 모델 수렴 문제와 훈련 노이즈를 감소시키기 위해.
  • 정규화 기법과 모델 앙상블 전략을 통해 모델 일반화 능력과 견고성을 향상시키기 위해.
  • 저자원 음성 번역 환경에서 데이터 품질과 훈련 최적화가 번역 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 강제 정렬(이른바 Gentle 및 Kaldi를 사용)과 프레임 대 문자 비율 기반의 이중 단계 데이터 정제 파이프라인을 적용했다.
  • fairseq 툴킷을 사용하여 CNN 기반의 시퀀스-투-시퀀스 모델을 훈련시켰으며, CNN은 음성 특징의 시간 해상도를 감소시켰다.
  • 가중치 정규화와 레이블 스무딩을 통해 모델 안정성과 성능을 향상시켰으며, 이는 검증 BLEU 점수를 1.0 포인트 향상시켰다.
  • 최근 10개의 모델 체크포인트 평균화를 통해 단일 최적 모델을 초월한 일반화 능력을 향상시켰다.
  • 독립적으로 훈련된 여러 모델 간 앙상블 디코딩을 통해 번역 품질을 추가로 향상시켰다.
  • 사전 훈련된 모델을 점진적으로 더 정제된 데이터 서브셋(병렬 → 정제 1 → 정제 2)으로 미세조정하여 견고성과 성능을 향상시켰다.

실험 결과

연구 질문

  • RQ1강제 정렬과 프레임 대 문자 비율 기반의 데이터 정제가 엔드 투 엔드 음성 번역 성능에 어떤 영향을 미치는가?
  • RQ2가중치 정규화와 레이블 스무딩과 같은 정규화 기법이 저자원 환경에서 모델 수렴과 BLEU 점수에 얼마나 기여하는가?
  • RQ3점차적으로 더 정제된 데이터 서브셋으로 미세조정하면, 전체 노이즈가 있는 데이터셋으로 직접 훈련하는 것보다 일관된 성능 향상이 이루어지는가?
  • RQ4체크포인트 평균화와 앙상블 디코딩은 일반화 능력과 테스트 성능 향상에 얼마나 효과적인가?
  • RQ5공식 IWSLT 2018 훈련 데이터만을 사용할 때, 모델 아키텍처와 훈련 전략이 BLEU 점수에 어떤 영향을 미치는가?

주요 결과

  • 정제된 데이터 서브셋(Clean 1 및 Clean 2)으로 미세조정함으로써 검증 BLEU 점수가 전체 '병렬' 데이터셋에서 4.66에서 9.69로 향상되어 데이터 품질의 가치를 입증했다.
  • 가중치 정규화와 레이블 스무딩의 조합은 기준 모델의 검증 세트에서 BLEU 점수를 1.0 포인트 향상시켰다.
  • 최고의 단일 모델은 테스트 세트에서 9.70 BLEU 점수를 기록했으며, 네 개 모델의 앙상블은 테스트 세트에서 10.24 BLEU 점수를 달성했다.
  • '병렬' 데이터셋에서 '정제 2' 서브셋으로의 미세조정은 정제된 데이터로 직접 훈련하는 것보다 0.94 BLEU 점수 향상을 이뤘다.
  • 체크포인트 평균화를 통해 최고의 모델 성능이 검증 세트에서 10.63에서 10.90 BLEU로 향상되었다.
  • 네 개 모델의 앙상블 디코딩은 검증 점수 11.60 BLEU를 기록했으며, 최고의 단일 모델 대비 1.0 BLEU 향상된 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.