Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous Speech-to-Speech Translation System with Neural Incremental ASR, MT, and TTS

Katsuhito Sudoh, Takatomo Kano|arXiv (Cornell University)|2020. 11. 10.
Natural Language Processing Techniques참고 문헌 31인용 수 9
한 줄 요약

이 논문은 영어에서 일본어로의 번역을 위한 완전히 인크리멘탈인 신경망 음성-음성 번역 시스템을 제안한다. 이 시스템은 신경망 인크리멘탈 자동 음성 인식(ASR), 기계 번역(MT), 텍스트-음성 합성(TTS)을 연쇄적으로 통합하여 구현한다. 시스템은 번역 품질을 유지하면서 최대 3초 이내의 낮은 처리 지연을 달성하였으며, 이는 음성-음성 번역의 동시 처리에서 지연과 품질 지표를 종합적으로 평가한 최초의 시스템 수준의 평가이다.

ABSTRACT

This paper presents a newly developed, simultaneous neural speech-to-speech translation system and its evaluation. The system consists of three fully-incremental neural processing modules for automatic speech recognition (ASR), machine translation (MT), and text-to-speech synthesis (TTS). We investigated its overall latency in the system's Ear-Voice Span and speaking latency along with module-level performance.

연구 동기 및 목표

  • 기존의 문장 수준 처리 방식에 비해 지연을 줄이는 실시간 동시 음성-음성 번역 시스템을 개발하기 위해.
  • ASR, MT, TTS 모듈 전반에 걸쳐 인크리멘탈 처리를 통해 음성-음성 번역에서의 높은 지연 문제를 해결하기 위해.
  • 종단 간 번역 품질을 평가하기 위해 시스템 수준의 지연(귀-음성 간격 및 말하기 지연)과 모듈 수준의 성능을 함께 평가하기 위해.
  • 실시간 환경에서 ASR에서 MT로의 오류 전파가 번역의 자연스러움과 적절성에 미치는 영향을 조사하기 위해.

제안 방법

  • 시스템은 세 가지 완전히 인크리멘탈인 신경망 모듈의 연쇄 구조를 사용한다: 인크리멘탈 ASR(교사-학생 정복을 통한), 인크리멘탈 MT(대기-k 디코딩 사용), 인크리멘탈 TTS(강세 어절 경계에 의해 트리거됨).
  • 각 모듈은 왼쪽에서 오른쪽으로, 기호 동기화 방식으로 입력을 처리하여 최소한의 대기 시간으로 실시간 출력 생성을 가능하게 한다.
  • ASR 모듈은 인크리멘탈 추론 성능 향상을 위해 비인크리멘탈 교사 모델을 사용하여 훈련된다.
  • MT 모듈은 k개의 입력 토큰을 지연시키는 대기-k 전략을 적용하여 지연과 번역 품질 사이의 균형을 맞춘다.
  • TTS 모듈은 다음 강세 어절을 감지한 후에 합성 작업을 시작하여 출력 지연을 최소화한다.
  • 시스템 수준의 지연은 귀-음성 간격과 말하기 지연을 통해 측정되며, 모듈 수준의 성능 평가는 WER, CER, BLEU, MOS를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1저지연을 갖춘 실시간 동시 음성-음성 번역을 위한 완전히 인크리멘탈 신경망 파이프라인을 어떻게 설계할 수 있는가?
  • RQ2인크리멘탈 ASR에서 인크리멘탈 MT로의 오류 전파가 번역 품질에 미치는 영향은 무엇인가?
  • RQ3인크리멘탈 MT에서의 대기-k 전략이 지연과 번역 적절성의 균형에 미치는 영향은 어떠한가?
  • RQ4실시간 번역 환경에서 인크리멘탈 TTS가 자연스러움을 유지하고 말하기 지연을 최소화할 수 있는 정도는 어느 정도인가?
  • RQ5연쇄적 인크리멘탈 음성-음성 번역 시스템의 시스템 수준 지연 특성(귀-음성 간격 및 말하기 지연)은 어떠한가?

주요 결과

  • 모든 모듈에서 최대 처리 지연이 약 3초 이내로 측정되어 실시간 동시 번역의 가능성은 입증되었다.
  • 인크리멘탈 ASR의 단어 오류율(WER)은 Talk 1에서 0.344, Talk 2에서 0.221이며, 각각 CER는 0.199와 0.117였다.
  • 인크리멘탈 MT의 BLEU-4 점수는 낮았으며(Talk 1에서 3.5, Talk 2에서 4.9), 도메인 및 스타일 불일치로 인해 자동 평가에 큰 도전 과제가 있음을 시사한다.
  • 주관적 평가 결과, 적절성은 중간 수준(1.76–1.94/5), 자연스러움은 중간 수준(2.48–2.54/5)이었으며, 두 번째 발표에서 더 높은 점수를 기록하여 도메인에 따라 성능이 달라지는 것을 확인했다.
  • 인크리멘탈 TTS의 평균 의견 점수(MOS)는 2.34와 2.55였으며, 자연스러움 수준은 중간 정도로 평가되었으며, 두 번째 발표에서 더 높은 점수를 기록했다.
  • 번역 예시 분석 결과 오류 전파 문제를 확인할 수 있었으며, 예를 들어 'dog'를 'dark'로 잘못 번역하거나 'relief workers'를 'another viewpoint'로 잘못 번역하는 등 실시간 맥락 처리의 어려움을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.