Skip to main content
QUICK REVIEW

[論文レビュー] Testing Untestable Neural Machine Translation: An Industrial Case

Wujie Zheng, Wenyu Wang|arXiv (Cornell University)|Jul 6, 2018
Adversarial Robustness in Machine Learning参考文献 21被引用数 4
ひとこと要約

本論文は、参照翻訳が不要なイン・ビボ・ニューラルマシン翻訳(NMT)テストのための新規テストオラクルを提案する。自然言語の体系的特性——例えば語/句の一貫性や構造的整合性——を入力と出力の両方で分析することで、翻訳エラーを示す兆候を特定し、WeChatで10億人以上のユーザーが利用する実環境での展開において高い有効性を示した。

ABSTRACT

Neural Machine Translation (NMT) has been widely adopted recently due to its advantages compared with the traditional Statistical Machine Translation (SMT). However, an NMT system still often produces translation failures due to the complexity of natural language and sophistication in designing neural networks. While in-house black-box system testing based on reference translations (i.e., examples of valid translations) has been a common practice for NMT quality assurance, an increasingly critical industrial practice, named in-vivo testing, exposes unseen types or instances of translation failures when real users are using a deployed industrial NMT system. To fill the gap of lacking test oracle for in-vivo testing of an NMT system, in this paper, we propose a new approach for automatically identifying translation failures, without requiring reference translations for a translation task; our approach can directly serve as a test oracle for in-vivo testing. Our approach focuses on properties of natural language translation that can be checked systematically and uses information from both the test inputs (i.e., the texts to be translated) and the test outputs (i.e., the translations under inspection) of the NMT system. Our evaluation conducted on real-world datasets shows that our approach can effectively detect targeted property violations as translation failures. Our experiences on deploying our approach in both production and development environments of WeChat (a messenger app with over one billion monthly active users) demonstrate high effectiveness of our approach along with high industry impact.

研究の動機と目的

  • 産業的 NMT システムのイン・ビボテストにおけるテストオラクルの欠如に取り組むこと。この状況では、参照翻訳が入手不可能である。
  • BLEU などの品質スコアに依存せず、リリース済み NMT システムにおける翻訳エラーを参照翻訳なしに検出すること。
  • モデル設計、実装、またはトレーニングデータにおける潜在的欠陥を示す、自然言語翻訳の体系的違反を特定すること。
  • 生産環境でのリアルタイムの障害検出と診断を可能にし、翻訳品質とシステム信頼性を向上させること。
  • 社内モデルの改善および他社の NMT プロバイダー間の診断を支援すること。

提案手法

  • 本手法は、実際のユーザー翻訳リクエストに基づくアイテムベースの協調フィルタリングを用いて、語/句の翻訳辞書を構築する。これは、ソースおよびターゲットテキスト間の共起パターンを活用する。
  • 体系的言語的特性(例えば、一貫しない語/句のマッピングや翻訳における構造的異常)の違反を検出することで、翻訳エラーを特定する。
  • 入力テキスト(ソース文)と出力翻訳の両方に対して統計的分析を実施し、言語的パターンの類似性を比較して異常を検出する。
  • トレーニングデータから得た130,000語の英語および180,000語の中国語の意味的語句の辞書を用いて、翻訳の一貫性を検証する。
  • 言語的規則性および文脈的一致性に基づくヒューリスティクスを適用し、参照出力が存在しない場合でも、期待されるパターンから逸脱する翻訳を特定する。
  • 本手法は生産環境および開発環境の両方で展開され、リアルタイムのユーザー要求を監視し、スケールに応じた問題検出を実現している。

実験結果

リサーチクエスチョン

  • RQ1産業的 NMT システムにおいて、参照翻訳にアクセスできない状況でも翻訳エラーを検出可能か?
  • RQ2参照出力が存在しない状況で、翻訳欠陥の信頼できる指標として機能する体系的言語的特性は何か?
  • RQ3本手法は、生産規模の NMT システムにおける実世界の翻訳エラーをどれほど効果的に特定できるか?
  • RQ4本手法は、モデル設計上の欠陥やデータ品質問題といった、モデルレベルの問題を検出可能か?
  • RQ5本手法は、異なる NMT プロバイダーおよび翻訳システムにどれほど一般化可能か?

主な発見

  • 本手法は、複数の産業的 NMT プロバイダーの翻訳において、意図的な特性違反を成功裏に検出できた。具体的には、一文字ずつ翻訳する問題や、ハイフン区切りや省略語の誤処理といった問題が含まれる。
  • 特定の欠陥、例えば一般的な食品用語の過剰翻訳(例:'Runeberg torte' が 'cake' に翻訳される)や、省略語の誤処理(例:'p.' が 'plasmodium' に翻訳される)を同定した。
  • 本手法により、実際のユーザーデータから130,000語の英語および180,000語の中国語の意味的語句を収集し、社内でのテストケースとしてモデル改善に活用した。
  • WeChat での展開は高い有効性を示し、自社の NMT システムおよび他社プロバイダーのシステム両方の問題を検出できた。
  • 本手法は、マルチ文字語句における文脈の無視といったモデル設計上の欠陥や、ハイフン区切り語の処理不能といった実装上の問題を明らかにした。これは、単なる品質スコアリングを越えた診断的価値を示している。
  • 本手法は、希少語や特定の語形変種に過剰適合するなど、トレーニングデータ品質に起因する問題の診断にも有効であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。