Skip to main content
QUICK REVIEW

[논문 리뷰] The USTC-NEL Speech Translation system at IWSLT 2018

Dan Liu, Junhua Liu|arXiv (Cornell University)|2018. 12. 06.
Natural Language Processing Techniques참고 문헌 1인용 수 17
한 줄 요약

이 논문은 USTC-NEL에서 제안한 하이브리드 파이프라인 음성 번역 시스템으로, 텍스트 정규화를 피하면서 데이터 증강을 통해 자동 음성 인식(ASR) 출력물에 직접 신경 기계 번역(NMT) 모델을 훈련시켜 번역 성능을 향상시킨다. 이 시스템은 IWSLT 2018에서 KIT 베이스라인 대비 14.9 BLEU 향상률을 기록하며, 텍스트 정규화를 통한 표준 파이프라인 시스템과 엔드 투 엔드 모델을 모두 능가한다. 이는 증강된 데이터와 문장 재구성 기법을 활용해 ASR가 생성한 텍스트를 NMT 훈련에 활용함으로써 달성된다.

ABSTRACT

This paper describes the USTC-NEL system to the speech translation task of the IWSLT Evaluation 2018. The system is a conventional pipeline system which contains 3 modules: speech recognition, post-processing and machine translation. We train a group of hybrid-HMM models for our speech recognition, and for machine translation we train transformer based neural machine translation models with speech recognition output style text as input. Experiments conducted on the IWSLT 2018 task indicate that, compared to baseline system from KIT, our system achieved 14.9 BLEU improvement.

연구 동기 및 목표

  • 기존의 음성 번역 파이프라인에서 오차 누적이 발생하는 문제를 해결하기 위해 ASR와 기계 번역 컴포넌트 간의 정렬을 향상시키는 것.
  • 텍스트 정규화 없이 원시 ASR 출력물에 직접 NMT 모델을 훈련시키는 것이 성능 향상에 기여하는지 조사하는 것.
  • 데이터 증강과 문장 재구성 기법이 음성 번역 품질 향상에 얼마나 효과적인지 평가하는 것.
  • 데이터 증강 기반 NMT를 적용한 파이프라인 시스템과 엔드 투 엔드 음성 번역 모델 간의 성능을 비교하는 것.
  • IWSLT 2018 음성 번역 벤치마크에서 최고 성능을 달성하는 것.

제안 방법

  • HMM 기반 하이브리드 모델을 사용하며, CNN과 LSTM 아키텍처를 적용하여 TED-LIUM2 및 IWSLT 데이터에서 강제 정렬과 신뢰도 필터링을 통해 훈련한다.
  • 비라벨링된 오디오(166시간)는 초기 ASR 모델을 사용해 번역하고, 신뢰도 기반으로 필터링하여 훈련 데이터를 확장한다.
  • 데이터 증강은 소음 주입 및 속도 변형(요소 0.8 및 1.2)을 통해 수행되며, 이로 인해 유효 훈련 데이터가 약 2,100시간으로 증가한다.
  • 신경 기계 번역(NMT) 모델은 WMT 2018의 단일 언어 데이터와 도메인 적응형 필터링을 활용해 ASR 출력물에 대해 훈련되며, 트랜스포머 아키텍처를 사용한다.
  • 문장 재구성은 ASR 이후 단계에서 수행되며, 장문의 발화를 의미적으로 일관된 조각들로 나누어 번역 품질을 향상시킨다.
  • 앙상블 디코딩 전략은 다수의 모델(정방향, 역방향, 텍스트 정규화, 엔드 투 엔드 모델)의 가설을 조합하며, 언어 모델과 NMT 모델을 활용해 재평가할 수 있다.

실험 결과

연구 질문

  • RQ1텍스트 정규화 없이 원시 ASR 출력물에 직접 NMT 모델을 훈련시키는 것이 음성 번역 성능 향상에 기여하는가?
  • RQ2ASR 출력물에 대한 데이터 증강이 엔드 투 엔드 및 파이프라인 음성 번역 시스템의 성능에 어떤 영향을 미치는가?
  • RQ3ASR 출력물을 기반으로 한 문장 재구성 기법이 VAD 기반 분할 방식보다 번역 품질 향상에 더 효과적인가?
  • RQ4IWSLT 2018에서 데이터 증강 기반 파이프라인 시스템의 성능은 엔드 투 엔드 음성 번역 모델과 비교해 어떻게 되는가?
  • RQ5다양한 디코딩 전략과 재평가 기법을 활용한 모델 앙상블이 BLEU 점수 향상에 상당한 기여를 할 수 있는가?

주요 결과

  • 제안된 데이터 증강 기반 파이프라인 시스템은 IWSLT 2018 테스트 세트에서 평균 30.26 BLEU 점수를 기록했으며, KIT 베이스라인(15.32 BLEU) 대비 14.9 BLEU 향상되었다.
  • 문장 재구성과 데이터 증강을 적용한 시스템(평균 28.76 BLEU)은 텍스트 정규화를 적용한 시스템(평균 27.41 BLEU)보다 성능이 뛰어났다.
  • 다양한 모델을 조합하고 언어 모델 및 엔드 투 엔드 모델을 활용해 재평가한 최고의 앙상블 시스템은 평균 30.26 BLEU를 기록했으며, 엔드 투 엔드 시스템(21.52 BLEU)을 크게 능가했다.
  • 원시 ASR 출력물에 데이터 증강 기반 NMT 모델을 훈련시킨 결과 28.76 BLEU를 기록했으며, 이는 텍스트 정규화를 적용한 시스템 및 문장 재구성 기법을 적용한 시스템보다 1.3 BLEU 높은 성능이었다.
  • 문장 재구성과 데이터 증강을 모두 적용한 시스템은 tst2010에서 28.98, tst2013에서 30.69, tst2015에서 25.99 BLEU를 기록했으며, 다양한 테스트 세트에서 일관된 성능 향상을 보였다.
  • 최종 주요 시스템(30.26 BLEU)은 대조적 엔드 투 엔드 시스템(21.52 BLEU)을 뛰어넘었으며, 이는 데이터 증강 기반 파이프라인 시스템이 여전히 이 벤치마크에서 엔드 투 엔드 모델을 능가할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.