Skip to main content
QUICK REVIEW

[논문 리뷰] Source and Target Bidirectional Knowledge Distillation for End-to-end Speech Translation

Hirofumi Inaguma, Tatsuya Kawahara|arXiv (Cornell University)|2021. 04. 13.
Natural Language Processing Techniques참고 문헌 47인용 수 5
한 줄 요약

이 논문은 종속형 번역 모델(Forward NMT)에서 유도된 번역과 역방향 번역 모델(Backward NMT)에서 생성된 복수의 원문 재진술을 활용하여 종단 간 음성 번역(E2E-ST)을 위한 양방향 지식 정련(SeqKD)을 제안한다. 단일 디코더를 사용해 목표 번역과 원문 재진술을 동시에 예측함으로써 의미 표현 학습을 향상시키며, 순차적 및 비순차적 모델 모두에서 일관되게 성능 향상을 이룬다. 특히, 이중 방향 SeqKD는 단방향 대안보다 뛰어나며, 다양한 모델 크기 간 일반화 능력까지 확보한다.

ABSTRACT

A conventional approach to improving the performance of end-to-end speech translation (E2E-ST) models is to leverage the source transcription via pre-training and joint training with automatic speech recognition (ASR) and neural machine translation (NMT) tasks. However, since the input modalities are different, it is difficult to leverage source language text successfully. In this work, we focus on sequence-level knowledge distillation (SeqKD) from external text-based NMT models. To leverage the full potential of the source language information, we propose backward SeqKD, SeqKD from a target-to-source backward NMT model. To this end, we train a bilingual E2E-ST model to predict paraphrased transcriptions as an auxiliary task with a single decoder. The paraphrases are generated from the translations in bitext via back-translation. We further propose bidirectional SeqKD in which SeqKD from both forward and backward NMT models is combined. Experimental evaluations on both autoregressive and non-autoregressive models show that SeqKD in each direction consistently improves the translation performance, and the effectiveness is complementary regardless of the model capacity.

연구 동기 및 목표

  • 음성 인식(ASR)과 기계 번역(MT) 작업 간 입력 모odal이 다름에도 불구하고 원어 번역 텍스트를 효과적으로 활용하는 데 어려움이 존재하는 종단 간 음성 번역(E2E-ST) 문제를 해결하고자 한다.
  • 보조 ASR 훈련의 한계를 해결하고자 하며, 이는 모델이 청각적 표현보다 의미적 표현에 치우치게 하는 경향을 완화하기 위함이다.
  • 텍스트 기반 NMT 모델의 의미 지식을 시퀀스 수준 지식 정련(Sequence-level Knowledge Distillation, SeqKD)을 통해 활용하여 E2E-ST 성능을 향상시키고자 한다.
  • 목표어에서 원어로의 NMT 모델을 활용해 생성된 원문 재진술을 이용한 역방향 SeqKD를 제안하고자 한다.
  • 전방 및 후방 NMT 모델의 지식을 통합하여 이중 방향 SeqKD를 개발함으로써 모델의 일반화 능력과 강건성을 향상시키고자 한다.

제안 방법

  • 병렬 비텍스트 데이터를 기반으로 전방 NMT 모델을 훈련하여 E2E-ST 훈련에 사용할 유도된 목표 번역을 생성한다.
  • 목표어에서 원어로의 NMT 모델(역방향 NMT 모델)을 훈련하여 목표 번역에서 원문 재진술을 생성한다.
  • 생성된 재진술을 금본 번역과 함께 단일 디코더 아키텍처에서 보조 훈련 타겟으로 사용한다.
  • 유도된 번역(전방)과 재진술된 원문(후방) 양쪽을 동시에 훈련 데이터로 활용하여 이중 방향 SeqKD를 구현한다.
  • 사전 훈련된 NMT 모델에서 고품질이고 다양한 훈련 데이터를 생성하기 위해 비트맵 검색 기반의 시퀀스 수준 지식 정련을 적용한다.
  • 유도된 데이터 분포의 복잡성과 충실도를 측정하기 위해 정렬 기반 조건부 엔트로피와 KL 발산을 사용한다.

실험 결과

연구 질문

  • RQ1목표어에서 원어로의 NMT 모델에서 유도된 역방향 시퀀스 수준 지식 정련이 원어 의미를 활용함으로써 E2E-ST 성능 향상에 기여할 수 있는가?
  • RQ2전방 및 후방 SeqKD를 통합하면 단일 방향 SeqKD보다 더 높은 성능을 내는가?
  • RQ3이중 방향 SeqKD는 순차적 모델 외에도 비순차적 모델을 포함한 다양한 모델 아키텍처에서 일반화 능력에 어떤 영향을 미치는가?
  • RQ4신경적 재진술 기법이 원본 데이터 분포에 비해 충실도와 복잡성을 얼마나 잘 유지하는가?
  • RQ5제안된 방법은 대규모 E2E-ST 모델에서도 성능 향상을 유지하는가?

주요 결과

  • 이중 방향 SeqKD는 순차적 및 비순차적 E2E-ST 모델 전반에서 일관되게 번역 성능 향상을 이끌었으며, Fisher 및 Must-C 데이터셋에서 성능 향상이 관찰되었다.
  • 역방향 SeqKD만으로도 Fisher에서 1.2 BLEU, Must-C에서 1.8 BLEU 향상되었으며, 원문 재진술 지도 학습의 가치를 입증하였다.
  • 전방 SeqKD만으로도 Fisher에서 1.0 BLEU, Must-C에서 1.5 BLEU 향상되었으며, 유도된 목표 번역의 효과성을 입증하였다.
  • 전방 및 후방 SeqKD의 조합은 가장 높은 성능을 기록하였으며, Must-C에서 단일 방향 SeqKD보다 최대 2.0 BLEU 향상되었다.
  • 이중 방향 SeqKD의 효과는 대규모 Conformer 기반 모델을 포함한 다양한 모델 용량에서도 유지되었으며, 일반화 능력이 뛰어나다.
  • KL 발산과 조건부 엔트로피 측정 결과, 유도된 데이터는 높은 충실도와 합리적인 복잡성을 유지하여 신뢰할 수 있는 지식 전이가 이루어졌음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.