Skip to main content
QUICK REVIEW

[論文レビュー] QuickEdit: Editing Text & Translations by Crossing Words Out

David Grangier, Michael Auli|arXiv (Cornell University)|Nov 13, 2017
Natural Language Processing Techniques参考文献 29被引用数 7
ひとこと要約

QuickEditは、ユーザーが置き換えたい語を打ち消すことで、テキストおよび翻訳の編集を可能にするニューラルシーケンス・ツー・シーケンスモデルを提案する。モデルはマークされたトークンを避けるように再構成された文を生成する。翻訳後の編集において最大5 BLEUポイントの向上を達成し、類似するベースラインよりも人間評価で優れたパラフレージング性能を示した。

ABSTRACT

We propose a framework for computer-assisted text editing. It applies to translation post-editing and to paraphrasing. Our proposal relies on very simple interactions: a human editor modifies a sentence by marking tokens they would like the system to change. Our model then generates a new sentence which reformulates the initial sentence by avoiding marked words. The approach builds upon neural sequence-to-sequence modeling and introduces a neural network which takes as input a sentence along with change markers. Our model is trained on translation bitext by simulating post-edits. We demonstrate the advantage of our approach for translation post-editing through simulated post-edits. We also evaluate our model for paraphrasing through a user study.

研究の動機と目的

  • 最小限のユーザー入力で簡単かつインタラクティブなテキストおよび翻訳編集手法を開発すること。
  • ユーザーが完全な再表現や複雑なフィードバックを必要とせず、避けるべき語をマークするだけで文を編集できるようにすること。
  • 翻訳ビットテキスト上でシミュレートされた翻訳後編集を用いて、マークされたトークンを避けるように再構成された文を生成するニューラルモデルを訓練すること。
  • 翻訳後の編集および単語言語のパラフレージングの両設定において、このアプローチを評価すること。
  • 最小限のユーザーのマークで高品質でスムーズで正確な再表現が得られることを示すこと。

提案手法

  • モデルは、畳み込みシーケンス・ツー・シーケンスモデル(Gehring et al., 2017)に基づくマルチヘッドアテンションを備えたエンコーダ・デコーダアーキテクチャを採用している。
  • 入力として元の文と、出力で避けるべきトークンを示すバイナリマスクを受け取る。
  • 参照翻訳に存在しないトークンを変更対象とマークすることで、シミュレートされた翻訳後編集を用いて訓練する。
  • データ漏洩を防ぐために、元の文、参照文、生成文をシャッフルして訓練データを構築する。
  • 意味を保持しながらマークされた語を避けることで、多様でスムーズで正確な再表現を学習する。
  • ユーザーがマークしたトークンに基づいて削除、挿入、再配置を適切に学習できる、新しい訓練手順を確立する。

実験結果

リサーチクエスチョン

  • RQ1最小限のユーザー操作(避けるべき語のマーク)で、効果的なテキストおよび翻訳編集が可能か?
  • RQ2意味を保持しながらマークされたトークンを避ける再構成文をニューラルモデルがどれほど正確に生成できるか?
  • RQ3このアプローチは、翻訳後の編集およびパラフレージングタスクにおいて、既存の手法を上回るか?
  • RQ4限られたユーザー入力での編集生成において、モデルがどれほど流暢さと正確性を維持できるか?
  • RQ5同じモデルが単語言語のパラフレージングと翻訳後の編集の両タスクに一般化可能か?

主な発見

  • WMT’14 英語-ドイツ語およびドイツ語-英語翻訳タスクにおいて、QuickEditは、翻訳後編集ベースラインと比較して最大5ポイントのBLEUスコア向上を達成した。
  • WMT’14-en-fr 翻訳セットでは、QuickEditは53.4のBLEUスコアを達成し、ベースライン(47.8)および強力なニューラルMTシステム(40.2)を顕著に上回った。
  • MTCデータセットにおける人間評価では、QuickEditは72%の文で正確なパラフレージングを生成したのに対し、ParaNetは56%であった。
  • 流暢さに関しては、QuickEditの53%のパラフレージングが元の文と同等またはそれ以上の流暢さであると評価されたが、ParaNetは37%であった。
  • QuickEditはParaNetよりも入力からの内容をより多く保持しており、意味を短縮したり歪めたりする傾向を避けた。
  • ユーザースタディーの結果、特に編集強度の高い太字パラフレージング設定において、QuickEditはより正確で流暢なパラフレージングを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。