Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Testing and Improvement of Machine Translation

Zeyu Sun, Jie M. Zhang|arXiv (Cornell University)|Oct 7, 2019
Software Testing and Debugging Techniques参考文献 40被引用数 4
ひとこと要約

本稿では、文脈的に類似する変異と変異テストを用いて機械翻訳システム内の翻訳の一貫性の欠如を検出し、修復する完全自動フレームワーク、TransRepairを提案する。この手法は、一貫性のあるテストペアを生成する際、99%の精度を達成し、Google Translate や Transformer における一貫性の欠如バグの19–30%を修復する。手動評価では、87%の修復翻訳が一貫性を向上させ、27%が翻訳の受容性を向上させた。

ABSTRACT

This paper presents TransRepair, a fully automatic approach for testing and repairing the consistency of machine translation systems. TransRepair combines mutation with metamorphic testing to detect inconsistency bugs (without access to human oracles). It then adopts probability-reference or cross-reference to post-process the translations, in a grey-box or black-box manner, to repair the inconsistencies. Our evaluation on two state-of-the-art translators, Google Translate and Transformer, indicates that TransRepair has a high precision (99%) on generating input pairs with consistent translations. With these tests, using automatic consistency metrics and manual assessment, we find that Google Translate and Transformer have approximately 36% and 40% inconsistency bugs. Black-box repair fixes 28% and 19% bugs on average for Google Translate and Transformer. Grey-box repair fixes 30% bugs on average for Transformer. Manual inspection indicates that the translations repaired by our approach improve consistency in 87% of cases (degrading it in 2%), and that our repairs have better translation acceptability in 27% of the cases (worse in 8%).

研究の動機と目的

  • 文脈に依存する誤訳、例えば性別に基づく差異などによって生じる機械翻訳システムにおける公平性および一貫性の欠如バグを是正すること。
  • ソースコードや人間のオラクルを必要としない、完全自動でブラックボックスのテストおよび修復技術を開発すること。
  • 文脈的に類似する変異によって引き起こされる翻訳の破壊を検出し、参照ベースの修復を用いた後処理により翻訳の一貫性を向上させること。
  • Google Translate や Transformer などの最先端の翻訳システムにおける一貫性欠如の修復に、ブラックボックスおよびグレイボックスの修復戦略がどの程度効果的であるかを評価すること。
  • 再トレーニングを伴わずに、自動化された修復が翻訳の一貫性と受容性を向上させられることを実証すること。

提案手法

  • 文の構造を保ちながら、意味的・文脈的に類似する代替語(例:性別を示す代名詞や類義語)に語を置き換えることで、文脈的に類似する変異を適用し、テスト入力を生成する。
  • 元の文と変異させた文の翻訳を比較することで変異テストを実行し、翻訳の変化しない部分が顕著に異なる場合に一貫性の欠如を特定する。
  • 類似度メトリクス(例:埋め込みベース)を用いて、翻訳部分列における破壊度を定量化し、しきい値を超える潜在的な一貫性欠如バグを特定する。
  • ブラックボックス修復を実装し、元のモデルを変更せずに、変異させた入力からの参照翻訳を用いて翻訳を後処理する。
  • 内部モデル動作(例:注目メカニズムや隠れ状態)を活用して後処理をガイドするグレイボックス修復を適用する(利用可能な場合)。
  • 確率ベースの参照またはクロスリファレンス技術を用いて、複数のテストケースにおける一貫性に基づいて翻訳を選択または精緻化する。

実験結果

リサーチクエスチョン

  • RQ1人間のオラクルを必要とせず、文脈的に類似する変異と変異テストを組み合わせることで、機械翻訳システムにおける一貫性欠如バグを効果的に検出できるか?
  • RQ2Google Translate や Transformer などの最先端翻訳システムは、どの程度文脈に依存する翻訳の一貫性欠如を示しているか?
  • RQ3ブラックボックスおよびグレイボックスの後処理技術が、検出された一貫性欠如バグを自動で修復でき、翻訳品質を維持または向上させられるか?
  • RQ4元の翻訳と比較して、修復プロセスは翻訳の一貫性と受容性をどの程度効果的に向上させられるか?
  • RQ5自動化された翻訳出力の後処理において、修復の正確性と翻訳品質のトレードオフはどのようなものか?

主な発見

  • TransRepair は、一貫性のある翻訳をもたらすテスト入力ペアの生成において99%の精度を達成しており、テストケース生成の信頼性が非常に高いことを示している。
  • 評価の結果、Google Translate と Transformer は、文脈的に類似する変異の下でそれぞれ約36%および40%の一貫性欠如バグを示していることが判明した。
  • ブラックボックス修復は、Google Translate で平均28%、Transformer で19%の一貫性欠如を修復し、実運用環境での有効性が裏付けられた。
  • グレイボックス修復は、Transformer で平均30%の修復率を達成し、内部モデル動作のアクセスが修復の有効性を高めることを示している。
  • 手動による検査では、87%の修復翻訳が一貫性を向上させており、わずか2%のみが劣化したことが確認され、修復プロセスの信頼性が非常に高いことが示された。
  • 受容性の観点からも、27%の修復翻訳が元の翻訳よりも良いと評価された一方で、わずか8%が悪いと評価されたため、全体として流暢さと自然さの向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。