Skip to main content
QUICK REVIEW

[논문 리뷰] Consecutive Decoding for Speech-to-text Translation

Qianqian Dong, Mingxuan Wang|arXiv (Cornell University)|2020. 09. 21.
Natural Language Processing Techniques인용 수 13
한 줄 요약

이 논문은 연속 디코딩을 사용하여 단일 디코더 내에서 원천 음성의 전사와 목표 언어 번역을 동시에 생성하는 통합형 엔드 투 엔드 프레임워크인 COSTT를 제안한다. 사전 훈련된 모델과 보조 CTC 감독을 활용함으로써 COSTT는 오류 전파를 줄이고 대규모 병렬 MT 데이터를 효과적으로 활용하며, 보다 넓은 외부 데이터를 요구하지 않아도 세 가지 주요 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Speech-to-text translation (ST), which directly translates the source language speech to the target language text, has attracted intensive attention recently. However, the combination of speech recognition and machine translation in a single model poses a heavy burden on the direct cross-modal cross-lingual mapping. To reduce the learning difficulty, we propose COnSecutive Transcription and Translation (COSTT), an integral approach for speech-to-text translation. The key idea is to generate source transcript and target translation text with a single decoder. It benefits the model training so that additional large parallel text corpus can be fully exploited to enhance the speech translation training. Our method is verified on three mainstream datasets, including Augmented LibriSpeech English-French dataset, IWSLT2018 English-German dataset, and TED English-Chinese dataset. Experiments show that our proposed COSTT outperforms or on par with the previous state-of-the-art methods on the three datasets. We have released our code at \url{https://github.com/dqqcasia/st}.

연구 동기 및 목표

  • 엔드 투 엔드 음성-텍스트 번역 모델에서 오류 전파 문제와 데이터 활용도 제한 문제를 해결하기 위해.
  • cascaded 및 엔드 투 엔드 시스템 간 격차를 해소하기 위해 단일 프레임워크 내에서 ASR 및 MT 모듈을 공동으로 훈련할 수 있도록 하기 위해.
  • 기본 엔드 투 엔드 모델에서 일반적으로 어려운 점인 대규모 병렬 단일 언어 MT 코퍼스를 엔드 투 엔드 ST 훈련에 효과적으로 활용할 수 있도록 하기 위해.
  • 엔드 투 엔드의 장점을 유지하면서도 cascaded 시스템의 데이터 효율성을 통합한 유연하고 통합된 아키텍처를 개발하기 위해.

제안 방법

  • COSTT는 두 단계 아키텍처를 사용한다: 음성 특징을 압축된 표현으로 인코딩하는 음성-의미(AS) 단계와 그 다음에 이어지는 전사-번역(TT) 단계.
  • TT 단계는 단일 공유 디코더를 사용하여 원천 언어의 전사와 목표 언어 번역을 연속적인 순서로 생성함으로써 공동 모델링을 가능하게 한다.
  • 사전 훈련 단계에서 음소 수준의 정렬에 대해 CTC 손실을 적용하여 ASR 감독을 향상시키며, 추론 시 음소가 필요하지 않더라도 효과적이다.
  • 계산 비용을 줄이고 훈련 안정성을 향상시키기 위해 디코더에 축소 연산을 적용한다.
  • 디코더는 ASR 데이터로 사전 훈련하고 ST 데이터로 미세 조정함으로써 대규모 ASR 및 MT 코퍼스에서의 전이 학습을 가능하게 한다.
  • 모델은 인퍼런스 시에灵活性를 제공한다: ASR 출력은 TT 디코더의 첫 번째 부분에서 유도되며, 전체 모델은 엔드 투 엔드 ST를 수행한다.

실험 결과

연구 질문

  • RQ1통합형 엔드 투 엔드 프레임워크는 대규모 병렬 MT 데이터를 효과적으로 활용하면서 동시에 음성 인식과 번역을 공동으로 모델링할 수 있는가?
  • RQ2단일 디코더 내에서의 연속 디코딩은 전단계나 표준 엔드 투 엔드 모델보다 오류 전파를 줄이는가?
  • RQ3음소 수준의 정렬에 대한 보조 CTC 감독은 추론 시 명시적인 음소 출력이 필요 없이도 ASR 품질을 향상시킬 수 있는가?
  • RQ4번역 품질과 전사 오류에 대한 내성 면에서 제안된 프레임워크는 cascaded 및 엔드 투 엔드 기준 모델보다 어떻게 비교되는가?
  • RQ5독립적인 ASR 및 MT 데이터로의 사전 훈련을 통해 모델은 어느 정도 이점을 얻을 수 있으며, 동시에 강력한 ST 성능을 유지할 수 있는가?

주요 결과

  • COSTT는 세 가지 주요 벤치마크에서 최고 성능을 기록했다: Augmented LibriSpeech 영어-프랑스어, IWSLT2018 영어-독일어, TED 영어-중국어.
  • Augmented LibriSpeech 영-프랑스어 테스트 세트에서 COSTT는 BLEU 점수 18.23을 기록했으며, 3단계 파이프라인(12.22)과 2단계 파이프라인(17.58)을 모두 초월했다.
  • 사례 연구에서 COSTT는 기준 모델이 놓쳤거나 잘못 번역한 단어들인 'yes'와 'aboard'를 정확히 번역하여 내성성 향상을 입증했다.
  • 모델은 전사 오류에도 불구하고 회복할 수 있다 — 예를 들어 'today' 대신 'to day'를 예측하더라도 여전히 정확한 번역을 생성한다. 이는 고장 내성성을 보여준다.
  • CTC 감독과 축소 연산의 사용은 훈련 안정성을 향상시키고 ASR 및 MT 데이터에서의 효과적인 사전 훈련을 가능하게 한다.
  • COSTT를 통해 기존에 표준 엔드 투 엔드 ST 모델에서 일반적으로 활용도가 낮은 대규모 병렬 MT 코퍼스를 활용할 수 있게 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.