Skip to main content
QUICK REVIEW

[논문 리뷰] Bridging the Gap between Pre-Training and Fine-Tuning for End-to-End Speech Translation

Chengyi Wang, Yu Wu|arXiv (Cornell University)|2019. 09. 17.
Speech Recognition and Synthesis인용 수 7
한 줄 요약

이 논문은 종단 간 음성 번역 모델을 위한 Tandem Connectionist Encoding Network(TCEN)을 제안하며, 모든 하위망을 재사용하고 단계 간 역할 일관성을 유지하며 주의 모듈을 사전 훈련하여 사전 훈련과 미세 조정 간 격차를 해소한다. 공유된 투영 행렬과 길이 반사 데이터 증강을 통해 음성 표현과 텍스트 표현 간의 의미 일관성과 길이 일관성을 강제함으로써, LibriSpeech En-Fr에서 최대 17.05의 BLEU 향상을 달성한다.

ABSTRACT

End-to-end speech translation, a hot topic in recent years, aims to translate a segment of audio into a specific language with an end-to-end model. Conventional approaches employ multi-task learning and pre-training methods for this task, but they suffer from the huge gap between pre-training and fine-tuning. To address these issues, we propose a Tandem Connectionist Encoding Network (TCEN) which bridges the gap by reusing all subnets in fine-tuning, keeping the roles of subnets consistent, and pre-training the attention module. Furthermore, we propose two simple but effective methods to guarantee the speech encoder outputs and the MT encoder inputs are consistent in terms of semantic representation and sequence length. Experimental results show that our model outperforms baselines 2.2 BLEU on a large benchmark dataset.

연구 동기 및 목표

  • 종단 간 음성 번역 모델에서 사전 훈련과 미세 조정 간 큰 격차를 해결한다.
  • 기계 번역(MT) 인코더를 포함한 모든 사전 훈련된 구성 요소를 재사용하여 하위망 낭비를 방지한다.
  • 음성 및 언어 특징 추출을 분리함으로써 사전 훈련과 미세 조정 간 역할 일관성을 확보한다.
  • 정렬 지식을 활용하기 위해 주의 모듈을 사전 훈련한다.
  • 음성 인코더 출력과 MT 인코더 입력 간의 의미 일관성과 시퀀스 길이 일관성을 확보한다.

제안 방법

  • 음성 인코더, 텍스트 인코더, 타겟 디코더를 갖는 Tandem Connectionist Encoding Network(TCEN)을 제안하며, 음성 인코더는 디코더 없이 CTC 손실을 통해 사전 훈련된다.
  • 사전 훈련된 MT 인코더와 디코더를 재사용하여 유용한 하위망을 폐기하지 않는다.
  • CTC 레이어의 선형 투영 행렬을 단어 임bedding 행렬과 공유하여 음성과 텍스트 표현을 동일한 잠재 공간에 정렬한다.
  • MT 소스 문장을 단어 반복과 빈도 토큰을 추가하여 CTC 출력 시퀀스를 모방함으로써 시퀀스 길이 일관성을 확보한다.
  • 미세 조정 기간 동안 ASR, MT, ST 목표를 함께 사용하는 다중 작업 학습을 적용하며, 사전 훈련된 하위망을 초기화로 사용한다.
  • ST 작업을 위해 MT 모델의 주의 모듈을 사전 훈련하여 무작위 초기화를 방지한다.

실험 결과

연구 질문

  • RQ1기존 종단 간 ST 모델은 왜 ASR 및 MT 작업에서의 사전 훈련 지식을 완전히 활용하지 못하는가?
  • RQ2종단 간 음성 번역에서 사전 훈련과 미세 조정 간 도메인 격차를 어떻게 줄일 수 있는가?
  • RQ3음성 인코더 출력과 MT 인코더 입력 간의 의미 일관성과 시퀀스 길이 일관성을 보장할 수 있는 메커니즘은 무엇인가?
  • RQ4주의 모듈을 사전 훈련하면 얼마나 ST 성능이 향상되는가?
  • RQ5통합 아키텍처는 모든 사전 훈련된 하위망을 재사용하면서도 훈련 단계 간 일관된 역할을 유지할 수 있는가?

주요 결과

  • TCEN은 LibriSpeech En-Fr 데이터셋에서 BLEU 점수 17.05를 기록하여 사전 훈련 기반 모델과 지식 정렬 기반 모델을 모두 능가한다.
  • 제거 실험 결과, 가중치 공유를 제거하면 평균적으로 BLEU 점수가 1.45 포인트 감소함을 확인하여 의미 일관성이 노이즈 주입보다 더 중요함을 입증한다.
  • 사전 훈련을 제거할 경우 BLEU 점수가 8.98~8.42로 급격히 감소함을 확인하여 사전 훈련이 성능 향상에 필수적임을 확인한다.
  • 학습 곡선 분석 결과, TCEN은 더 높은 검증 정확도로 시작하며, 전체 미세 조정 과정 동안 기준 모델 대비 일관된 우월성을 유지함을 보여주며, 더 나은 초기화를 의미한다.
  • 모델은 LSTM과 Transformer 백본 모두에서 성능 향상을 보이며, 아키텍처 간 일반화 능력을 입증한다.
  • 기본 다중 작업 학습 기반 모델 대비 5 BLEU 포인트 향상되었으며, 교사 모델을 사용한 지식 정렬 기반 모델과도 동등하거나 승승을 거두었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.