Skip to main content
QUICK REVIEW

[논문 리뷰] Synchronous Speech Recognition and Speech-to-Text Translation with Interactive Decoding

Yuchen Liu, Jiajun Zhang|arXiv (Cornell University)|2019. 12. 16.
Natural Language Processing Techniques참고 문헌 27인용 수 9
한 줄 요약

이 논문은 상호작용적이고 동기화된 종단간 모델을 제안하며, 상호작용 어텐션 메커니즘을 통해 양방향 정보 흐름을 가능하게 함으로써 공동 음성 인식(ASR)과 음성-텍스트 번역(ST)을 동시에 수행한다. 각 작업이 상대방의 생성 출력에 대기-$k$ 정책을 사용해 어텐션할 수 있도록 함으로써, ASR 및 ST 성능이 향상되며, 파rameter 수를 늘리지 않고도 다양한 언어 쌍에서 TED 음성 번역 벤치마크에서 최고 성능을 기록한다.

ABSTRACT

Speech-to-text translation (ST), which translates source language speech into target language text, has attracted intensive attention in recent years. Compared to the traditional pipeline system, the end-to-end ST model has potential benefits of lower latency, smaller model size, and less error propagation. However, it is notoriously difficult to implement such a model without transcriptions as intermediate. Existing works generally apply multi-task learning to improve translation quality by jointly training end-to-end ST along with automatic speech recognition (ASR). However, different tasks in this method cannot utilize information from each other, which limits the improvement. Other works propose a two-stage model where the second model can use the hidden state from the first one, but its cascade manner greatly affects the efficiency of training and inference process. In this paper, we propose a novel interactive attention mechanism which enables ASR and ST to perform synchronously and interactively in a single model. Specifically, the generation of transcriptions and translations not only relies on its previous outputs but also the outputs predicted in the other task. Experiments on TED speech translation corpora have shown that our proposed model can outperform strong baselines on the quality of speech translation and achieve better speech recognition performances as well.

연구 동기 및 목표

  • 종단간 음성 번역에서 파ipeline 및 다중 작업 학습 접근법의 한계를 해결하기 위해 오류 전파, 상호작용 정보 공유 부족, 비효율성 문제를 해결한다.
  • 인식과 번역을 순차적으로 처리하는 이중 단계 모델의 비효율성을 해결하기 위해, 추론 지연을 줄이고 상호작용 정보 흐름을 가능하게 한다.
  • 단일 모델 내에서 음성 인식과 번역을 동기화되고 상호작용적으로 생성함으로써, 상호 감독을 통해 ASR 및 ST 품질을 향상시킨다.
  • 지연과 성능의 균형을 맞추기 위해 wait-$k$ 정책을 설계하여, 번역이 더 많은 음성 인식 문맥에 접근할 수 있도록 하면서도 실시간 처리 능력을 유지한다.
  • 상호작용 어텐션을 통한 공동 학습이 파ipeline, 종단간, 다중 작업, 이중 단계 모델과 같은 강력한 베이스라인을 능가함을 입증한다.

제안 방법

  • ASR 디코더가 ST 디코더의 출력에 어텐션할 수 있도록 하는 상호작용 어텐션 메커니즘을 도입하며, 반대로 ST 디코더도 ASR 생성 출력에 어텐션할 수 있도록 한다.
  • 양 작업에 공통된 인코더를 사용하고, 별도의 디코더를 통해 ASR 및 ST를 수행하며, 각 디코딩 단계에서 상호작용 어텐션을 통해 은닉 상태를 교환한다.
  • ST 디코더가 ASR 디코더보다 $k$ 단계 후에 출력을 생성하는 wait-$k$ 정책을 적용하여, 번역 시 더 많은 음성 인식 단어에 접근할 수 있도록 한다.
  • 공유된 인코더 파rameter를 사용한 다중 작업 학습을 적용하지만, 표준 다중 작업 학습과 달리 어텐션을 통해 디코더 간 동적 정보 교환을 가능하게 한다.
  • ASR 및 ST 목표를 조합한 공동 손실을 사용해 종단간으로 모델을 훈련시키며, 비드 서치 디코딩을 통해 두 작업 간 동기화를 유지한다.
  • 양쪽 출력이 동기화되고 번갈아가며 생성되도록 보장하기 위해 제약 조건이 있는 디코딩 전략을 사용한다.

실험 결과

연구 질문

  • RQ1ASR와 ST 간의 상호작용적 정보 흐름이 표준 다중 작업 학습을 넘어서 두 작업의 성능 향상에 기여하는가?
  • RQ2wait-$k$ 정책을 사용한 동기화된 상호작용 디코딩이 인식 성능을 저하시키지 않으면서 번역 품질을 향상시키는가?
  • RQ3이중 단계 또는 파ipeline 시스템보다 단일 모델이 음성 인식과 번역을 더 효율적으로 동시에 생성할 수 있는가?
  • RQ4wait-$k$ 정책이 종단간 ST에서 지연과 번역 품질 간의 상호 보완적 관계에 어떤 영향을 미치는가?
  • RQ5상호작용 어텐션은 독립적인 ASR 또는 ST 모델보다 오류 전파를 얼마나 줄일 수 있는가?

주요 결과

  • 제안된 상호작용 학습 모델은 네 가지 언어 쌍(영-독, 영-프랑스, 영-중, 영-일)에서 음성 인식 및 음성 번역 모두 최고 성능을 기록하며, 파ipeline, 종단간, 다중 작업, 이중 단계 베이스라인을 모두 능가한다.
  • wait-$k$ 정책에서 $k=3$일 때 전체 성능이 가장 우수하며, 영-중 번역 과제에서 베이스라인 종단간 모델 대비 BLEU 점수를 최대 2.1점 향상시킨다.
  • 모델의 파rameter 수는 61.2M로 종단간 및 다중 작업 모델과 동일하며, 이중 단계 모델보다 훨씬 빠른 추론 속도(11.98 vs. 7.44 문장/초)를 유지한다.
  • 상호작용 모델은 4.23단계/초의 훈련 속도를 기록하여 이중 단계 모델(1.13단계/초)보다 빠르며, 종단간 모델과 유사한 수준이다.
  • 사례 연구 결과, 복잡한 어휘 조합인 'the biggest challenges' 및 'brainstormed on solutions'를 정확히 인식하고 번역하는 데 성공하였으며, 베이스라인은 잘못된 인식 또는 번역으로 실패한다.
  • 모델은 상호 작용적 맥락을 활용해 오류 전파를 줄인다: 음성 인식 결과는 번역에 도움이 되며, 번역 결과는 모호한 음성 맥락에서 인식을 안내한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.