Skip to main content
QUICK REVIEW

[논문 리뷰] What Level of Quality can Neural Machine Translation Attain on Literary Text?

Antonio Toral, Andy Way|arXiv (Cornell University)|2018. 01. 15.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 연구는 12편의 유명한 소설에서 1억 명 이상의 병렬 텍스트를 기반으로 NMT 시스템과 어절 기반 통계적 번역(PBSMT) 시스템을 훈련시켜 문학적 텍스트에서의 신경 기계 번역(NMT) 성능을 평가한다. NMT는 PBSMT를 크게 앞서며 BLEU 점수에서 3점의 절대적 향상(11% 상대적 향상)을 기록했고, 인간 평가에 따르면 소설에 따라 17–34%의 경우에서 인간 수준의 번역 품질을 달성한다.

ABSTRACT

Given the rise of a new approach to MT, Neural MT (NMT), and its promising performance on different text types, we assess the translation quality it can attain on what is perceived to be the greatest challenge for MT: literary text. Specifically, we target novels, arguably the most popular type of literary text. We build a literary-adapted NMT system for the English-to-Catalan translation direction and evaluate it against a system pertaining to the previous dominant paradigm in MT: statistical phrase-based MT (PBSMT). To this end, for the first time we train MT systems, both NMT and PBSMT, on large amounts of literary text (over 100 million words) and evaluate them on a set of twelve widely known novels spanning from the the 1920s to the present day. According to the BLEU automatic evaluation metric, NMT is significantly better than PBSMT (p < 0.01) on all the novels considered. Overall, NMT results in a 11% relative improvement (3 points absolute) over PBSMT. A complementary human evaluation on three of the books shows that between 17% and 34% of the translations, depending on the book, produced by NMT (versus 8% and 20% with PBSMT) are perceived by native speakers of the target language to be of equivalent quality to translations produced by a professional human translator.

연구 동기 및 목표

  • 최신 기술의 신경 기계 번역(NMT)이 문학적 텍스트, 특히 소설에서 달성할 수 있는 번역 품질을 평가하기 위해.
  • 도메인 내 문학적 병렬 데이터에서 NMT 성능을 이전의 주요 기반인 어절 기반 통계적 기계 번역(PBSMT)과 비교하기 위해.
  • NMT가 전문 번역가의 번역과 수준이 비슷한 품질의 번역을 문학적 콘텐츠에서 생성할 수 있는지 평가하기 위해.
  • 어휘의 풍부함, 훈련 데이터 대비 신선도, 문장 길이와 같은 텍스트적 특징이 NMT 성능이 PBSMT에 비해 얼마나 향상되는지에 미치는 영향을 조사하기 위해.

제안 방법

  • 12편의 널리 알려진 소설에서 1억 명 이상의 병렬 텍스트를 기반으로 NMT 시스템과 PBSMT 시스템을 훈련시켰다.
  • 모든 12편의 소설에서 BLEU 지표를 사용해 NMT와 PBSMT 성능을 자동 평가하였다.
  • Appraise 도구를 사용해 NMT, PBSMT, 전문 번역가의 번역을 3편의 소설에서 인간 평가를 실시하여 순위를 매겼다.
  • TrueSkill 알고리즘을 적용하여 각 번역 유형(Human, NMT, PBSMT)에 대한 통계적으로 유의미한 총점(p < 0.05)을 도출하였다.
  • NMT가 PBSMT에 비해 상대적으로 얼마나 향상되었는지와 소설 특성(어휘의 풍부함, 신선도, 평균 문장 길이) 간의 상관관계를 분석하였다.
  • 쌍별 순위 분석을 통해 인간 평가에서 NMT와 PBSMT의 번역 품질을 3편의 소설 전반에 걸쳐 비교하였다.

실험 결과

연구 질문

  • RQ1NMT는 도메인 내 문학적 텍스트, 특히 소설에서 PBSMT에 비해 유의미하게 높은 번역 품질을 달성할 수 있는가?
  • RQ2NMT는 얼마나 많은 비율로 번역 품질이 전문 번역가의 수준과 동일시되는 것으로 평가되는가? 특히 모국어 사용자 기준으로 평가할 때.
  • RQ3어휘의 풍부함, 훈련 데이터 대비 신선도, 문장 길이와 같은 텍스트적 특징은 NMT가 PBSMT에 비해 성능 향상에 얼마나 기여하는가?
  • RQ4품질과 인간의 인식을 기반으로 NMT가 전문 문학 번역가의 후속 편집 작업을 보조할 잠재력을 얼마나 지니고 있는가?

주요 결과

  • BLEU 지표에 따르면 NMT는 모든 12편의 소설에서 PBSMT를 유의미하게 뛰어넘었으며, 절대적 향상 3점(상대적 향상 11%), p < 0.01을 기록했다.
  • 인간 평가 결과, NMT 번역의 17–34%가 전문 번역가의 번역과 동일한 품질로 평가되었으며, PBSMT는 8–20%에 그쳤다.
  • 모든 3편의 소설에서 NMT는 41.4–54.7%의 경우에서 PBSMT보다 높은 순위를 기록했고, PBSMT와 NMT가 동점이 된 경우는 27.8–39.4%였다.
  • TrueSkill를 통해 유도된 종합 인간 평가 점수는 NMT가 PBSMT를 상회하고 번역가의 번역보다 낮게 평가되었으며, NMT는 PBSMT 기준으로 인간 수준 품질에 18–22%의 거리에 도달했다.
  • 문장 길이 외에는 NMT의 상대적 향상과의 상관관계가 의미 있는 결과를 보이지 않았고, 문장 길이가 길어질수록 성능 향상이 감소하는 경향을 보였다.
  • 평균 문장 길이가 가장 긴 소설에서는 NMT가 PBSMT에 비해 상대적으로 낮은 향상을 보였으며, 이는 문장 길이가 성능 변동의 핵심 요인임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.