Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Representations Improve End-to-End Speech Translation

Anne Wu, Changhan Wang|arXiv (Cornell University)|2020. 06. 22.
Natural Language Processing Techniques참고 문헌 31인용 수 4
한 줄 요약

이 논문은 자기지도 학습된 음성 표현—특히 wav2vec, vq-wav2vec, 그리고 BERT 특징—이 고자원 및 저자원 설정 모두에서 엔드 투 엔드 음성 번역(ST) 성능을 크게 향상시킨다는 것을 보여준다. 이러한 특징들은 영어의 레이블이 없는 데이터로 사전 훈련된 후, 최소한의 튜닝으로도 다른 언어로 효과적으로 전이되며, 음성 인식(ASR) 사전 훈련과 결합할 경우 특히 저자원 환경에서 성능 향상을 더 높일 수 있다.

ABSTRACT

End-to-end speech-to-text translation can provide a simpler and smaller system but is facing the challenge of data scarcity. Pre-training methods can leverage unlabeled data and have been shown to be effective on data-scarce settings. In this work, we explore whether self-supervised pre-trained speech representations can benefit the speech translation task in both high- and low-resource settings, whether they can transfer well to other languages, and whether they can be effectively combined with other common methods that help improve low-resource end-to-end speech translation such as using a pre-trained high-resource speech recognition system. We demonstrate that self-supervised pre-trained features can consistently improve the translation performance, and cross-lingual transfer allows to extend to a variety of languages without or with little tuning.

연구 동기 및 목표

  • 자기지도 학습된 사전 훈련된 음성 표현이 고자원 및 저자원 설정 모두에서 엔드 투 엔드 음성 번역 성능을 향상시키는지 조사하는 것.
  • 이러한 표현이 최소한의 미세조정 없이 저자원 언어로의 다국어 간 전이 가능성 평가하기.
  • 자기지도 학습 특징과 사전 훈련된 ASR 시스템을 결합하여 저자원 ST에서의 효과성 검토하기.
  • 사전 훈련 방법을 사용할 경우, ASR 성능이 최종 ST 성능을 신뢰할 수 있는 지표로 간주될 수 있는지 평가하기.

제안 방법

  • 자기지도 사전 훈련 방법을 활용: wav2vec(대비 예측 코드), vq-wav2vec(벡터 양자화 표현), BERT(이산 표현에 기반).
  • 이러한 사전 훈련된 특징을 순서-순서 BiLSTM 인코더-디코더 모델의 입력 표현으로 사용하며, 주어진 ST 작업에 대해 어텐션 메커니즘을 적용.
  • 저자원 ST 작업을 위한 사전 훈련된 BERT 모델을 인코더로 사용하는 하이브리드 BERT-백본 아키텍처를 탐색.
  • 목표 언어(예: 프랑스어, 중국어)의 Common Voice 데이터에서 사전 훈련된 특징을 미세조정하여 다국어 간 전이 성능 향상.
  • 영어 및 목표 언어 데이터로 사전 훈련된 ASR 모델을 활용해 ST 인코더를 웜스타트함으로써 저자원 설정에서 일반화 성능 향상.
  • 모든 실험에서 비교를 위해 기준으로 사용된 로그-멜 필터뱅크 특징 사용.

실험 결과

연구 질문

  • RQ1자기지도 학습된 음성 표현은 고자원 및 저자원 설정 모두에서 엔드 투 엔드 음성 번역 성능을 향상시킬 수 있는가?
  • RQ2자기지도 학습 특징은 추가 튜닝 없이 저자원 언어로 얼마나 잘 전이되는가?
  • RQ3자기지도 학습 특징과 ASR 사전 훈련을 결합하면 단독으로 사용할 경우보다 더 나은 ST 성능을 얻을 수 있는가?
  • RQ4사전 훈련 작업에서의 ASR 성능은 최종 ST 성능을 신뢰할 수 있는 지표로 간주될 수 있는가?

주요 결과

  • wav2vec, vq-wav2vec, BERT 등의 자기지도 학습 특징은 영어-X 및 X-영어 설정 모두에서 로그-멜 필터뱅크 특징보다 일관되게 ST 성능을 향상시켰다.
  • 영어로 사전 훈련된 특징을 11개의 저자원 언어로 다국어 간 전이한 결과, 미세조정 없이도 성능 향상이 있었지만, 성능 향상 정도는 데이터 양과 언어 유사성에 영향을 받았다.
  • 목표 언어의 Common Voice 데이터에서 BERT 특징을 미세조정한 결과, 고정된 특징 대비 Fr-En ST에서 최대 +1.3, Zh-En ST에서 최대 +1.1의 BLEU 점수 향상이 관찰되었다.
  • 영어 및 목표 언어 데이터로 다국어 ASR 모델을 사전 훈련하여 ST 인코더를 초기화한 결과, 영어 전용 ASR로 인코더와 디코더를 모두 사전 훈련한 것보다 더 나은 ST 성능을 기록했으며, Es-En ST에서 최대 +1.6 BLEU 향상이 있었다.
  • 어떤 경우에서는 더 높은 WER(예: vq-wav2vec)를 가진 ASR 모델이 더 낮은 WER(예: BERT)를 가진 모델보다 더 나은 ST 결과를 내는 경우가 있었으며, 이는 ASR WER가 ST 성능을 예측하는 데 신뢰할 수 없는 지표임을 시사한다.
  • BERT-백본 아키텍처는 저자원 설정에서 초기 학습보다 더 나은 성능을 기록했으며(예: Zh-En ST에서 6.8 BLEU), 그러나 ASR 사전 훈련보다는 성능이 열등했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.