Skip to main content
QUICK REVIEW

[논문 리뷰] Low-Latency Neural Speech Translation

Jan Niehues, Ngoc-Quan Pham|arXiv (Cornell University)|2018. 08. 01.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 신경 기계 번역(NMT) 모델을 저지연 음성 번역에 적응시키기 위해 합성된 부분문 데이터를 활용한 다중 작업 학습 접근법을 제안한다. 이는 완전문장 성능을 훼손하지 않은 채, 미완의 발화를 실시간으로 정확하게 번역할 수 있도록 하며, 점진적 출력에서 수정 빈도를 45% 감소시켜 실시간 시스템에서 사용자 경험을 크게 향상시킨다.

ABSTRACT

Through the development of neural machine translation, the quality of machine translation systems has been improved significantly. By exploiting advancements in deep learning, systems are now able to better approximate the complex mapping from source sentences to target sentences. But with this ability, new challenges also arise. An example is the translation of partial sentences in low-latency speech translation. Since the model has only seen complete sentences in training, it will always try to generate a complete sentence, though the input may only be a partial sentence. We show that NMT systems can be adapted to scenarios where no task-specific training data is available. Furthermore, this is possible without losing performance on the original training data. We achieve this by creating artificial data and by using multi-task learning. After adaptation, we are able to reduce the number of corrections displayed during incremental output construction by 45%, without a decrease in translation quality.

연구 동기 및 목표

  • 실시간 처리 중에 부분적인 음성 입력을 받은 NMT 모델이 완전문장을 생성함으로써 잘못되거나 중복된 번역이 발생하는 문제를 해결하기 위해.
  • 특정 작업 데이터로 재학습하지 않고도 사전에 훈련된 NMT 모델을 추론 시점에서 부분문을 처리할 수 있도록 적응시키기 위해.
  • 점진적 출력 구축 중 번역 수정 횟수를 최소화함으로써 실시간 음성 번역에서 사용자 경험을 향상시키기 위해.
  • 다중 작업 학습을 통해 합성된 부분문을 활용할 경우, 모델의 동작이 저지연 음성 번역 요구사항과 효과적으로 일치하는지 탐색하기 위해.

제안 방법

  • 실시간 음성 입력을 시뮬레이션하기 위해, 원천 및 목표 언어 문장이 모두 부분형태(불완전한 형태)인 병렬 단일어 코퍼스를 인위적으로 생성한다.
  • 동일한 아키텍처에서 완전문장과 부분문장 번역을 동시에 학습할 수 있도록 다중 작업 학습을 통해 NMT 모델을 훈련시킨다.
  • 공유된 인코더-디코더 트랜스포머 아키텍처와 공유된 어텐션 메커니즘을 사용하며, 디코더는 완전한 입력과 부분 입력 모두에 적절한 출력을 생성하도록 최적화된다.
  • 과다 생성과 긴 출력을 방지하는 보상 함수를 사용한 강화 학습(RL)을 적용하여, 부분 입력에 대한 강인성을 더욱 향상시킨다.
  • 다중 작업 학습과 RL 미세조정을 조합하여 번역 품질과 저지연 보정 최소화를 동시에 최적화한다.
  • 모델의 적응성을 평가하기 위해 전체 문장, 부분 문장, 자동 음성 인식(ASR) 출력을 대상으로 평가를 수행하여 다양한 입력 유형에 대한 강인성을 확보한다.

실험 결과

연구 질문

  • RQ1도메인 특화 데이터로 재학습하지 않고도 NMT 모델이 실시간 음성 번역 중 부분문장을 효과적으로 번역하도록 적응시킬 수 있는가?
  • RQ2합성된 부분문 데이터를 활용한 다중 작업 학습이 완전문장 성능를 유지하면서도 부분 입력에 대한 번역 강인성을 향상시키는가?
  • RQ3강화 학습이 점진적 번역에서 과다 생성과 수정 횟수를 얼마나 더 줄일 수 있는가?
  • RQ4합성 데이터와 다중 작업 학습의 조합이 기준 미세조정 대비 수정 감소와 번역 품질 측면에서 어떻게 비교되는가?

주요 결과

  • 다중 작업 학습 접근법은 기준 모델 대비 점진적 번역에서 재작성된 토큰 수를 45% 감소시켜 사용자 경험을 크게 향상시켰다.
  • 완전문장에 대한 BLEU 점수는 유지되거나 약간 향상되어 원래 훈련 데이터에 대한 성능 저하가 없음을 입증했다.
  • 강화 학습은 부분문장 번역에서 과다 생성과 단어 반복을 줄이는 데 더욱 효과적이었으며 성능을 향상시켰다.
  • 다중 작업 학습과 RL의 조합은 수정 빈도를 최대 50%까지 감소시켜, 개별적으로 적용했을 때보다 뛰어난 성능을 달성했다.
  • 다중 작업 모델은 짧고 불완전한 입력에 더 잘 일반화되었으며, 문장 부호 오류에 더 강인하게 대응했고, 기준 모델은 종종 부호 없이 입력된 부분문장에서 실패하는 경향이 있었다.
  • 독일어-영어 번역에서는 부분문 입력에서 수정 횟수를 25% 감소시켰지만, 영어-스페인어 번역에 비해 효과가 더 작았는데, 이는 독일어의 더 큰 문법 재배열 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.