Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Robustness of Speech Translation

Xiang Li, Haiyang Xue|arXiv (Cornell University)|2018. 11. 02.
Natural Language Processing Techniques참고 문헌 28인용 수 14
한 줄 요약

이 논문은 깨끗한 훈련 데이터에 ASR 전용 노이즈를 주입하고 보조 특징으로 중국어 파inyin를 통합함으로써 음성 번역에서 신경 기계 번역(NMT)의 강인성을 향상시키는 단순하면서도 효과적인 방법을 제안한다. 이 방법은 노이즈가 있는 입력에서 성능을 크게 향상시켜 평균 3.12 BLEU 포인트 향상시키며, 동시에 깨끗한 테스트 세트에서도 일반화 능력을 향상시킨다.

ABSTRACT

Although neural machine translation (NMT) has achieved impressive progress recently, it is usually trained on the clean parallel data set and hence cannot work well when the input sentence is the production of the automatic speech recognition (ASR) system due to the enormous errors in the source. To solve this problem, we propose a simple but effective method to improve the robustness of NMT in the case of speech translation. We simulate the noise existing in the realistic output of the ASR system and inject them into the clean parallel data so that NMT can work under similar word distributions during training and testing. Besides, we also incorporate the Chinese Pinyin feature which is easy to get in speech translation to further improve the translation performance. Experiment results show that our method has a more stable performance and outperforms the baseline by an average of 3.12 BLEU on multiple noisy test sets, even while achieves a generalization improvement on the WMT'17 Chinese-English test set.

연구 동기 및 목표

  • ASR가 생성한 번역문에서 자주 발생하는 발음 오류를 포함한 음성 인식 오류가 있는 입력에 대해 신경 기계 번역(NMT)의 강인성 격차를 해소하기 위해.
  • 실제 ASR 출력물에 대해 NMT를 훈련시키기 위한 데이터 부족 문제를 해결하기 위해 훈련 중에 ASR 전용 노이즈를 시뮬레이션함으로써.
  • ASR 오류 수준이 다양할 경우에도 언어학적 특징(예: 중국어 파인진)을 통합하여 NMT의 일반화 능력과 안정성을 향상시키기 위해.
  • 구조적 변경이나 적대적 훈련이 필요 없으며 실용적인 구현이 가능한 계산 효율성이 높은 방법을 개발하기 위해.

제안 방법

  • 각 훈련 반복 동안 소스 토큰을 청각적으로 유사하거나 유사 발음인 문자로 무작위로 교체하여 깨끗한 병렬 훈련 데이터에 ASR 전용 노이즈를 주입한다.
  • 음운학적 유사성 기반으로 네 가지 전략을 정의하여 노이즈 토큰을 선택하며, 이는 동음이의어와 일반적인 ASR 오류 패턴을 포함한다.
  • 문자 수준 표현과 음절 수준의 파인진 특징을 결합하는 파인진 인식 임베딩 레이어를 도입하여 노이즈 상황에서도 의미 일관성을 향상시킨다.
  • 손실 함수를 수정하거나 사전 훈련이 필요 없이 표준 목표 함수를 사용하여 NMT 모델을 엔드 투 엔드로 훈련시킨다.
  • 희소한 음성-번역 쌍 대신 대규모 문장 병렬 코퍼스를 활용하여 스케일링 가능한 데이터 증강을 가능하게 한다.
  • 실제 세계의 ASR 오류 패턴을 모방하기 위해 다양한 노이즈 분포를 사용하여 다양한 노이즈 수준에서의 강인성을 확보한다.

실험 결과

연구 질문

  • RQ1NMT 훈련 중에 ASR 전용 노이즈를 주입함으로써 깨끗한 데이터 성능에 손상이 가지 않고도 ASR 출력에서의 노이즈에 대한 강인성을 향상시킬 수 있는가?
  • RQ2보조 입력 특징으로 중국어 파인진을 통합할 경우 ASR 오류 상황에서 NMT의 강인성과 번역 품질에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 테스트 세트에서 다양한 수준의 노이즈 심각도에 대해 일반화되는가?
  • RQ4다양한 오류 비율을 가진 여러 테스트 세트에서 안정적인 성능 향상이 달성되는가?
  • RQ5기존의 노이즈 주입 또는 적대적 훈련 방법에 비해 효율성과 효과성 측면에서 제안된 방법은 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 기준 모델 대비 여러 노이즈가 있는 테스트 세트에서 평균 3.12 BLEU 포인트 향상시켜 NMT 성능을 향상시켰다.
  • 간단한 NMT 시스템은 매우 노이즈가 많은 테스트 세트에서 BLEU 점수 2.72를 기록했으며, 이는 깨끗한 테스트 세트의 2.9 BLEU 점수에 근접하여 강력한 안정성을 보였다.
  • 일반화 능력이 향상되어 WMT’17 중국어-영어 테스트 세트에서 성능 향상을 기록하여 전체 모델 용량 향상이 확인되었다.
  • 다양한 노이즈 수준에서 안정된 성능 유지를 유지했으며, 고오류율 테스트 세트에서 2.72 BLEU 점수를 기록한 반면 기준 모델은 2.01 BLEU 점수에 머물렀다.
  • 파인진 특징 통합은 실제 사례 연구를 통해 유사 발음 오류 복구 능력을 크게 향상시켰다.
  • 복잡한 훈련 절차(예: 적대적 훈련 또는 사전 훈련)를 피하면서도 기존의 노이즈 주입 방법보다 깨끗한 데이터 성능에 해를 끼치지 않고도 성능을 뛰어나게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.