Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Machine Translation Performance on Chinese Idioms with a Blacklist Method

Yutong Shao, Rico Sennrich|arXiv (Cornell University)|2017. 11. 21.
Natural Language Processing Techniques참고 문헌 12인용 수 5
한 줄 요약

이 논문은 신경 기계 번역(NMT)에서 흔한 어순 번역 오류를 탐지하기 위해 정제된 단어 목록(블랙리스트)을 활용하는 블랙리스트 기반 방법을 제안한다. 이 방법은 중국어 성어 번역에서 어순 번역 오류를 자동으로 평가하는 데 사용되며, 특히 성어의 의미를 그대로 번역하는 오류를 탐지한다. 이 방법은 이러한 오류를 높은 정밀도로 식별할 수 있으며, 테스트 세트에서 46.1%의 성어 번역이 잘못 번역된 것으로 드러나, 성어 번역이 여전히 NMT에서 중요한 과제임을 확인한다.

ABSTRACT

Idiom translation is a challenging problem in machine translation because the meaning of idioms is non-compositional, and a literal (word-by-word) translation is likely to be wrong. In this paper, we focus on evaluating the quality of idiom translation of MT systems. We introduce a new evaluation method based on an idiom-specific blacklist of literal translations, based on the insight that the occurrence of any blacklisted words in the translation output indicates a likely translation error. We introduce a dataset, CIBB (Chinese Idioms Blacklists Bank), and perform an evaluation of a state-of-the-art Chinese-English neural MT system. Our evaluation confirms that a sizable number of idioms in our test set are mistranslated (46.1%), that literal translation error is a common error type, and that our blacklist method is effective at identifying literal translation errors.

연구 동기 및 목표

  • 기계 번역에서 중국어 성어에 특화된 자동 평가 방법의 부족을 해결하기 위해.
  • 신경 기계 번역 시스템에서 흔한 어순 번역 오류(즉, 성어를 어절별로 번역하는 것)를 식별하고 정량화하기 위해.
  • 인간 평가와 BLEU와 같은 글로벌 지표를 보완하는 저비용이고 확장 가능한 평가 방법을 개발하기 위해.
  • 재현 가능한 성어 번역 평가를 위해 CIBB 데이터셋을 공개하기 위해.
  • 최근 신경 기계 번역의 발전에도 불구하고 어순 번역 오류가 여전히 일반적인 오류 유형임을 입증하기 위해.

제안 방법

  • 중국어 성어의 어순 번역에서 유래한 단어들(예: 说三道四에 대해 '세', '네')로 구성된 블랙리스트를 구축하여, 어순 번역 오류의 징후로 사용한다.
  • 번역 결과물에 블랙리스트에 포함된 단어가 포함되어 있는지 스캔하여 MT 시스템 출력에 적용한다.
  • 50개의 비조합적 중국어 성어에 대해 1,194개의 중국어-영어 번역 쌍을 포함한 CIBB 데이터셋을 사용해 방법을 평가한다.
  • 블랙리스트가 어순 번역 오류를 올바르게 경고할 경우를 '정확한 탐지'로 정의하고, 인간이 애너테이션한 기준과 비교해 정밀도와 재현율을 평가한다.
  • 최신 신경 기계 번역 시스템을 대상으로 사례 연구를 수행하여, 블랙리스트 기반 방법을 활용한 성능 평가를 수행한다.
  • 일치 분석과 문맥 분석을 통해 가짜 양성 결과(예: 블랙리스트 단어가 성어 외의 맥락에서 나타날 경우)를 줄인다.

실험 결과

연구 질문

  • RQ1현재의 신경 기계 번역 시스템은 중국어 성어 번역에서 어느 정도 어순 번역을 생성하는가?
  • RQ2블랙리스트 기반 방법은 중국어-영어 기계 번역 출력에서 어순 번역 오류를 효과적으로 탐지할 수 있는가?
  • RQ3성어 번역에 대해 인간 평가와 글로벌 지표와 비교할 때, 블랙리스트 방법의 정밀도와 재현율은 어떠한가?
  • RQ4테스트 세트에서 성어 번역의 어느 정도 비율이 어순 번역 오류에 영향을 받는가?
  • RQ5블랙리스트 방법은 다른 언어 쌍으로 확장 가능할까? 또는 다른 오류 탐지 기법과 통합될 수 있는가?

주요 결과

  • 테스트 세트에서 성어 번역의 46.1%가 잘못 번역되어, 중국어-영어 신경 기계 번역에서 성어 번역이 여전히 중요한 과제임을 확인한다.
  • 어순 번역 오류는 흔한 오류 유형이었으며, 블랙리스트 방법은 높은 정밀도로 이러한 오류를 성공적으로 탐지하였다.
  • 예를 들어, 说三道四가 'The doctor said that you can’t say three things to me'로 번역된 경우, 'three'와 'four'가 블랙리스트에 포함되어 있어 오류를 정확히 식별하였다.
  • 블랙리스트 단어가 성어 외의 맥락에서 나타날 경우 가짜 양성 결과가 발생했으며, 이는 문맥 필터링의 필요성을 시사한다.
  • 비어순 오류(예: 生龙活虎가 'have to'로 잘못 번역된 경우)는 탐지하지 못해, 이 방법이 어순 오류에만 국한됨을 확인한다.
  • 50개의 성어에 대해 1,194개의 번역 쌍을 포함한 CIBB 데이터셋은 재현 가능한 평가와 향후 연구를 지원하기 위해 공개되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.