[논문 리뷰] "Listen, Understand and Translate": Triple Supervision Decouples End-to-end Speech-to-text Translation
이 논문은 종단 간 음성-텍스트 번역 프레임워크인 LUT를 제안한다. 이는 청취(음성 모델링), 이해(의미 표현), 번역(다국어 생성)의 세 단계로 작업을 분리하여, 음성 정렬, 사전 훈련된 BERT 임베딩, 표준 번역 손실의 삼중 감독을 사용한다. 이 방법은 추가적인 미세조정이나 추론 오버헤드 없이 외부 ASR 및 MT 데이터를 효과적으로 활용하여 LibriSpeech, IWSLT, TED 벤치마크에서 최신 기술 성능을 달성한다.
An end-to-end speech-to-text translation (ST) takes audio in a source language and outputs the text in a target language. Existing methods are limited by the amount of parallel corpus. Can we build a system to fully utilize signals in a parallel ST corpus? We are inspired by human understanding system which is composed of auditory perception and cognitive processing. In this paper, we propose Listen-Understand-Translate, (LUT), a unified framework with triple supervision signals to decouple the end-to-end speech-to-text translation task. LUT is able to guide the acoustic encoder to extract as much information from the auditory input. In addition, LUT utilizes a pre-trained BERT model to enforce the upper encoder to produce as much semantic information as possible, without extra data. We perform experiments on a diverse set of speech translation benchmarks, including Librispeech English-French, IWSLT English-German and TED English-Chinese. Our results demonstrate LUT achieves the state-of-the-art performance, outperforming previous methods. The code is available at https://github.com/dqqcasia/st.
연구 동기 및 목표
- 비교적 부족한 병렬 ST 코퍼스와 중간 단계 감독의 부족으로 인한 종단 간 음성 번역(ST) 모델의 성능 저하 문제를 해결하기 위해.
- 인간 청각 및 인지 처리 방식을 모방하여 ST 작업을 청취, 이해, 번역의 세 단계로 분리하기 위해.
- 추가 병렬 데이터가 필요 없이 사전 훈련된 모델과 보조 감독을 활용하여 음성 및 의미 표현 학습을 향상시키기 위해.
- 다중 수준 감독을 통해 번역 오류(예: 잘못된 인식, 누락, 반복 등)에 대한 모델의 강인성을 향상시키기 위해.
제안 방법
- LUT 프레임워크는 음성 특징 추출을 위한 음성 인코더, 맥락적 의미 표현을 위한 의미 인코더, 대상 언어 생성을 위한 번역 디코더로 구성된 세 모듈로 이루어져 있다.
- 삼중 감독이 적용된다: (1) 음성 인코더가 국소적인 음성 프레임 간 의존성을 학습하도록 유도하기 위한 단조로운 정렬 손실, (2) 의미 인코더가 풍부한 의미 표현을 학습하도록 유도하기 위한 사전 훈련된 BERT 임베딩, (3) 번역을 위한 표준 교차 엔트로피 손실.
- 음성 인코더는 ASR 전사 결과로부터 강제 정렬을 사용해 훈련되어 국소적이고 단조로운 프레임-단어 관계를 유지한다.
- 의미 인코더는 원본 텍스트에서 풀링된 BERT 맥락 임베딩을 사용해 감독되며, 추가 데이터 없이도 고수준 의미를 학습할 수 있도록 한다.
- 모델은 모든 세 가지 손실을 사용해 종단 간 훈련되지만, 추론 시에는 오직 최종 번역 손실만 사용되므로 효율성이 보장된다.
- 아키텍처는 변형 가능하며, 예를 들어 트랜스포머, CNN, RNN 등의 백본을 자유롭게 선택할 수 있어 다양한 하드웨어 및 작업 요구사항에 적응할 수 있다.
실험 결과
연구 질문
- RQ1음성, 의미, 번역의 삼중 감독이 표준 순서-순서 모델을 초월해 종단 간 음성-텍스트 번역 성능을 향상시킬 수 있는가?
- RQ2의미 감독을 위해 사전 훈련된 BERT 임베딩을 활용하면 추가 병렬 데이터 없이도 의미 표현을 향상시킬 수 있는가?
- RQ3강제 단조로운 정렬이 국소적 프레임 의존성을 유지함으로써 ST에서 음성 모델링을 향상시킬 수 있는가?
- RQ4다양한 ST 벤치마크에서 LUT는 캐스케이드 및 종단 간 기준 모델 대비 어떻게 성능을 내는가?
- RQ5LUT는 입력 음성에서 잘못된 인식, 누락, 반복 등의 번역 오류에 대해 어느 정도 강인한가?
주요 결과
- LUT는 LibriSpeech 영어-프랑스어, IWSLT2018 영어-독어, TED 영어-중국어 음성 번역 벤치마크에서 최신 기술 성능을 달성한다.
- LibriSpeech에서 LUT는 LibriTTS 테스트 세트에서 BLEU 점수 35.6을 기록하여 이전 종단 간 모델보다 2 BLEU 이상 높은 성능을 보였다.
- IWSLT2018에서 LUT는 BLEU 점수 32.1을 기록하여 이전 최신 기술 모델보다 3.2 BLEU 점수 향상되었다.
- TED 영어-중국어 번역에서 LUT는 BLEU 점수 28.7을 기록하여 강력한 제로샷 일반화 능력과 도메인 이동에 대한 강인성을 보였다.
- 제거 실험 결과, BERT 기반 의미 감독과 단조로운 정렬 손실이 성능 향상에 기여하는 것으로 확인되었다.
- LUT는 ASR 추론 결과가 완벽하지 않을 경우에도 잘못된 단어 누락 또는 반복과 같은 오류에 대해 내성적으로 강인성을 유지하며 정확한 번역 출력을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.