Skip to main content
QUICK REVIEW

[논문 리뷰] QuickEdit: Editing Text & Translations by Crossing Words Out

David Grangier, Michael Auli|arXiv (Cornell University)|2017. 11. 13.
Natural Language Processing Techniques참고 문헌 29인용 수 7
한 줄 요약

QuickEdit는 사용자가 교체하고자 하는 단어를 취소선으로 표시함으로써 텍스트 및 번역 편집을 가능하게 하는 신경 시퀀스-투-시퀀스 모델을 제안한다; 이 모델은 표시된 토큰을 피하는 재구성된 문장을 생성한다. 번역 후 편집에서 최대 5 BLEU 포인트 향상을 달성했으며, 재구성 작업에서 강력한 베이스라인을 능가하는 인간 평가 결과를 확보했다.

ABSTRACT

We propose a framework for computer-assisted text editing. It applies to translation post-editing and to paraphrasing. Our proposal relies on very simple interactions: a human editor modifies a sentence by marking tokens they would like the system to change. Our model then generates a new sentence which reformulates the initial sentence by avoiding marked words. The approach builds upon neural sequence-to-sequence modeling and introduces a neural network which takes as input a sentence along with change markers. Our model is trained on translation bitext by simulating post-edits. We demonstrate the advantage of our approach for translation post-editing through simulated post-edits. We also evaluate our model for paraphrasing through a user study.

연구 동기 및 목표

  • 최소한의 사용자 입력을 통해 간단하고 상호작용적인 텍스트 및 번역 편집 방법을 개발하는 것.
  • 사용자가 전체 재구성이나 복잡한 피드백 없이도 편집하고자 하는 단어를 표시함으로써 문장을 편집할 수 있도록 하는 것.
  • 번역 비트렉스트에서 시뮬레이션된 후편집을 통해 표시된 토큰을 피하는 재구성된 문장을 생성할 수 있도록 신경 모델을 훈련하는 것.
  • 번역 후 편집 및 단일 언어 재구성 설정에서 이 방법을 평가하는 것.
  • 최소한의 사용자 표시가 고도로 품질이 높고 유창하며 정확한 재작성 결과를 이끌어내는지 입증하는 것.

제안 방법

  • 모델은 다중 헤드 어텐션을 갖춘 인코더-디코더 아키텍처를 사용하며, 컨볼루션 시퀀스-투-시퀀스 모델(Gehring 등, 2017)을 기반으로 한다.
  • 입력으로는 원본 문장과 출력에서 피해야 할 토큰을 나타내는 이진 마스크를 받는다.
  • 기준 번역에 포함되지 않은 토큰을 수정 대상으로 표시함으로써 시뮬레이션된 후편집을 통해 모델을 훈련한다.
  • 데이터 유출을 방지하기 위해 원본, 기준, 생성된 문장을 섞어 훈련 데이터를 구성한다.
  • 의미를 유지하면서 표시된 단어를 피하는 방식으로 다양한, 자연스럽고 정확한 재작성 문장을 생성하도록 모델을 학습한다.
  • 사용자가 표시한 토큰을 바탕으로 삭제, 삽입, 재정렬을 수행할 수 있도록 하는 새로운 훈련 절차를 확보한다.

실험 결과

연구 질문

  • RQ1최소한의 사용자 상호작용—편집하고자 하는 단어를 표시하는 것—이 효과적인 텍스트 및 번역 편집을 가능하게 할 수 있는가?
  • RQ2신경 모델이 의미를 유지하면서 표시된 토큰을 피하는 재구성된 문장을 얼마나 잘 생성할 수 있는가?
  • RQ3이 방법이 번역 후 편집 및 재구성 작업에서 기존 방법을 능가하는가?
  • RQ4제한된 사용자 입력으로도 모델이 얼마나 높은 유창성과 정확성을 유지하는가?
  • RQ5동일한 모델이 단일 언어 재구성과 번역 후 편집 작업 모두에 일반화 가능한가?

주요 결과

  • QuickEdit는 WMT’14 영어-독일어 및 독일어-영어 번역 작업에서 기준 후편집 모델 대비 최대 5 포인트의 BLEU 점수 향상을 달성했다.
  • WMT’14-en-fr 번역 세트에서 QuickEdit는 BLEU 점수 53.4를 기록했으며, 기준 모델(47.8)과 강력한 신경 기반 번역 시스템(40.2)을 크게 앞서나갔다.
  • MTC 데이터셋에서의 인간 평가 결과, QuickEdit는 72%의 문장에서 정확한 재구성 문장을 생성했으며, ParaNet의 경우 56%였다.
  • 유창성 측면에서 QuickEdit의 53%는 원본 문장과 동일하거나 더 유창한 것으로 평가되었고, ParaNet의 경우 37%였다.
  • QuickEdit는 ParaNet보다 입력 문장의 더 많은 내용을 유지했으며, 의미를 단순화하거나 왜곡하는 경향을 피했다.
  • 사용자 연구 결과, 특히 편집 강도가 높은 강력한 재구성 설정에서 QuickEdit가 더 정확하고 자연스러운 재구성 문장을 생성함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.