Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangling ASR and MT Errors in Speech Translation

Ngoc-Tien Le, Benjamin Lecouteux|arXiv (Cornell University)|2017. 09. 03.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 복합 음성 번역 시스템에서 오류의 원인을 ASR(자동 음성 인식)와 MT(기계 번역)로 분리하여 분석하는 3개 클래스 오류 검출 프레임워크를 제안한다. 공동 ASR 및 MT 특징을 사용하여 오류를 분리하고, 학습을 위한 두 가지 레이블 추출 방법을 도입하여, 프랑스어-영어 음성 번역에서 평균 48.00%의 F1 점수를 달성한다. 이는 종단 간 SLT 시스템에서 오류 원인을 식별하는 것이 가능하다는 것을 보여준다.

ABSTRACT

The main aim of this paper is to investigate automatic quality assessment for spoken language translation (SLT). More precisely, we investigate SLT errors that can be due to transcription (ASR) or to translation (MT) modules. This paper investigates automatic detection of SLT errors using a single classifier based on joint ASR and MT features. We evaluate both 2-class (good/bad) and 3-class (good/badASR/badMT ) labeling tasks. The 3-class problem necessitates to disentangle ASR and MT errors in the speech translation output and we propose two label extraction methods for this non trivial step. This enables - as a by-product - qualitative analysis on the SLT errors and their origin (are they due to transcription or to translation step?) on our large in-house corpus for French-to-English speech translation.

연구 동기 및 목표

  • 음성 번역 출력에서 ASR와 MT 오류를 구분하는 데 도전하는 것.
  • 이진(좋음/나쁨) 오류 검출을 넘어서 3개 클래스 분류(좋음, ASR-오류, MT-오류)로 향상시켜 SLT의 품질 평가를 개선하는 것.
  • 대규모 내부 프랑스어-영어 음성 번역 코퍼스에서 오류 원인을 할당하기 위한 두 가지 레이블 추출 방법을 개발하고 평가하는 것.
  • 공동 ASR 및 MT 특징을 사용하여 오류 유형을 자동으로 검출함으로써, 더 나은 시스템 진단 및 상호작용 번역 응용을 지원하는 것.
  • SLT에서 오류 원인에 대한 정성적 및 정량적 분석을 제공하여, 모델 개선을 위한 타겟팅된 조치를 가능하게 하는 것.

제안 방법

  • 각 번역 세그먼트를 양호, ASR 관련 오류, 또는 MT 관련 오류로 분류하는 3개 클래스 오류 검출 작업을 제안한다.
  • ASR 및 MT 모듈의 공동 특징을 기반으로 훈련된 단일 분류기를 사용하여 오류 유형을 예측한다.
  • 두 가지 다른 레이블 추출 방법을 적용한다: (1) WER 기반 ASR 오류 검출 및 TERp-A 기반 MT 오류 검출, 그리고 (2) ASR 및 MT 신뢰도 추정치를 조합하는 두 단계 접근 방식.
  • 번역 전체에 걸쳐 오류 레이블 시퀀스를 모델링하기 위해 CRF(조건부 확률 필드)를 사용한다.
  • 가중치 통합 모델을 통해 ASR 및 MT 구성 요소의 신뢰도 추정치를 통합한다: $ \hat{q} = \underset{q}{\arg\max} \{ p_{ASR}(q|x_f,f)^\alpha * p_{MT}(q|e,f)^{1-\alpha} \} $.
  • 대규모 내부 프랑스어-영어 음성 번역 코퍼스(테스트 발화 4050개)를 사용하여 개발 세트에서 훈련하고 테스트 세트에서 평가한다.

실험 결과

연구 질문

  • RQ1단일 분류기가 음성 번역 출력에서 ASR 및 MT 오류를 효과적으로 검출하고 분리할 수 있는가?
  • RQ2다양한 레이블 추출 전략이 SLT에서 3개 클래스 오류 레이블링의 신뢰성과 일관성에 어떤 영향을 미치는가?
  • RQ3기존의 2개 클래스 검출에 비해 3개 클래스 오류 검출이 F1 점수 및 오류 원인 식별 측면에서 얼마나 향상되는가?
  • RQ4종단 간 음성 번역 시스템에서 오류 원인을 탐지하는 데 있어 ASR 및 MT 특징의 공동 모델링이 얼마나 향상되는가?
  • RQ5실제 음성 번역 출력에서 ASR 및 MT 모듈 간 오류 분포는 어떻게 달라지는가?

주요 결과

  • 1단계 방법을 사용할 경우, 테스트 세트에서 평균 F1 점수 48.00%를 달성했으며, 양호한 경우 F1 48.00%, ASR 관련 오류 F1 44.00%, MT 관련 오류 F1 16.00%를 기록했다.
  • 2단계 레이블 추출 방법은 다소 낮은 성능(평균 F1 47.33%)을 보였지만, 일관된 오류 유형 분리가 이루어져 메서드의 타당성을 입증했다.
  • 혼동 행렬 분석 결과, MT 오류가 자주 ASR 오류로 잘못 분류되는 경향(예: 한 설정에서 55.54%의 MT 오류가 ASR 오류로 레이블링됨)을 보여, MT 신뢰도 추정의 향상 필요성을 시사했다.
  • ASR 관련 오류의 F1 성능에서 1단계 방법이 2단계 방법(85.00% 대비 83.14%)을 앞서는 등, ASR 및 MT 특징의 통합이 더 효과적임을 확인했다.
  • 오류 원인을 분리하는 것이 가능하며, 특히 상호작용 환경에서의 시스템 개선을 위한 실질적인 통찰을 제공함을 입증했다.
  • 결과적으로, ASR 및 MT 특징의 공동 모델링이 각각의 구성 요소를 별도로 모델링하는 것보다 오류 검출 성능을 크게 향상시킨다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.