Skip to main content
QUICK REVIEW

[논문 리뷰] The USFD Spoken Language Translation System for IWSLT 2014

Raymond W. M. Ng, Mortaza Doulaty|White Rose Research Online (University of Leeds, The University of Sheffield, University of York)|2015. 09. 13.
Natural Language Processing Techniques참고 문헌 17인용 수 8
한 줄 요약

이 논문은 IWSLT 2014 공동 과제를 위한 샤프 대학(USFD)의 음성 언어 번역(SLT) 시스템을 제시한다. 이 시스템은 두 개의 딥 뉴럴 네트워크 기반 음성 인식(ASR) 시스템과 어휘 기반 기계 번역(MT) 시스템을 통합한 것으로, 주요 기여는 예측된 번역 성능을 사용하여 ASR 10-best 출력을 재평가하는 품질 평가 기반 통합 방법이다. 이 방법은 주된 파이프라인 시스템 대비 영어→프랑스어 작업에서 BLEU 점수를 0.54 향상시키고, 영어→독일어 작업에서는 0.26 향상시켰다.

ABSTRACT

The University of Sheffield (USFD) participated in the International Workshop for Spoken Language Translation (IWSLT) in 2014. In this paper, we will introduce the USFD SLT system for IWSLT. Automatic speech recognition (ASR) is achieved by two multi-pass deep neural network systems with adaptation and rescoring techniques. Machine translation (MT) is achieved by a phrase-based system. The USFD primary system incorporates state-of-the-art ASR and MT techniques and gives a BLEU score of 23.45 and 14.75 on the English-to-French and English-to-German speech-to-text translation task with the IWSLT 2014 data. The USFD contrastive systems explore the integration of ASR and MT by using a quality estimation system to rescore the ASR outputs, optimising towards better translation. This gives a further 0.54 and 0.26 BLEU improvement respectively on the IWSLT 2012 and 2014 evaluation data.

연구 동기 및 목표

  • IWSLT 2014 평가를 위한 고성능 음성 언어 번역 시스템을 개발하기 위해.
  • 단순한 파이프라인을 초월하여 자동 음성 인식(ASR) 및 기계 번역(MT) 시스템을 통합하여 번역 품질을 향상시키기 위해.
  • ASR 출력을 재평가할 때 품질 평가의 효과성을 조사하기 위해.
  • 신뢰도 임계값과 특징 기반 재평가를 통해 N-best ASR 가설에 대한 시스템 통합을 최적화하기 위해.

제안 방법

  • TED 강의 및 추가 데이터를 기반으로 훈련된 두 개의 다중패스 딥 뉴럴 네트워크 기반 ASR 시스템(ASR 1 및 ASR 2)이 서로 다른 데이터 서브셋과 터널 특징 설정을 사용하여 훈련되었다.
  • 내영역 TED 데이터와 외영역 데이터(News Commentary, Common Crawl, Gigaword, Europarl)를 사용하여 어휘 기반 MT 모델을 훈련하였으며, 교차 엔트로피 차이(CED) 기준을 통해 데이터를 선택하였다.
  • IWSLT 2011 데이터의 10-best ASR 출력을 기반으로 117개의 QuEst 특징을 사용하여 번역 품질을 예측하는 품질 평가(QE) 모듈을 훈련시켰다.
  • QE 모델은 RBF 커널을 사용한 가우시안 프로세스를 활용하여 상위 58개 특징을 선별하고, 특징과 문장 수준의 METEOR 점수 간의 매핑을 학습하였다.
  • 예측된 번역 품질을 기반으로 ASR 10-best 출력을 재평가하였으며, 이때 낮은 신뢰도를 가진 가설에 대해서만 신뢰도 기반 재평가를 적용하였다.
  • 통합 시스템은 재평가된 ASR 가설을 기반으로 번역 출력을 향상시켰으며, 최종 MT 디코딩은 재평가된 ASR 가설을 대상으로 수행되었다.

실험 결과

연구 질문

  • RQ1품질 평가 기반 재평가가 음성 언어 번역에서 ASR 및 MT 시스템 통합에 기여할 수 있는가?
  • RQ2IWSLT 2014 평가 데이터에서 예측된 번역 품질을 사용하여 ASR N-best 출력을 재평가하는 것이 얼마나 효과적인가?
  • RQ3모든 가설에 대해 전역적으로 재평가하는 것과 비교해, 신뢰도 기반 재평가가 더 높은 성능을 내는가?
  • RQ4교차 엔트로피 차이 기준을 활용한 데이터 선택이 외부 영역 MT 및 ASR 성능에 어떤 영향을 미치는가?
  • RQ5표준 파이프라인과 비교했을 때 시스템 통합이 BLEU 및 TER 점수 측면에서 어떻게 성능을 내는가?

주요 결과

  • 주요 USFD SLT 시스템은 IWSLT 2014 영어→프랑스어 테스트 세트에서 BLEU 점수 23.45를 기록했고, 영어→독일어 테스트 세트에서는 14.75를 기록했다.
  • QE 기반 재평가를 적용한 대조 시스템은 주요 시스템 대비 영어→프랑스어 작업에서 BLEU 점수를 0.54 향상시키고, 영어→독일어 작업에서는 0.26 향상시켰다.
  • IWSLT 2014 데이터에서 신뢰도 기반 재평가를 통해 저신뢰도 문장의 55%를 재평가했을 때 BLEU 점수는 0.17 향상되었다.
  • IWSLT 2012 데이터에서는 신뢰도 기반 재평가가 BLEU 점수를 0.36 향상시켜, 저신뢰도 ASR 출력에서 더 높은 효과를 보였다.
  • QE 모듈은 RBF 커널을 사용한 가우시안 프로세스를 통해 117개 특징 중 58개를 선별하였으며, 이는 언어학적 특징과 모델 통계가 번역 품질의 강력한 예측 변수임을 시사한다.
  • 단일 언어 번역 시스템은 문장의 대문자 및 구두점 표기를 복원하여, 가짜 ASR 출력 기준 BLEU 88.0, 실제 ASR 출력 기준 BLEU 69.0을 기록하여 ASR 오류에 대해 매우 강력한 내재성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.