Skip to main content
QUICK REVIEW

[論文レビュー] Can Transformer be Too Compositional? Analysing Idiom Processing in Neural Machine Translation

Verna Dankers, Christopher G. Lucas|arXiv (Cornell University)|May 30, 2022
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文は、非構成的意味を持つにもかかわらず、Transformerベースのニューラル機械翻訳(NMT)モデルがなぜ頻繁に比喩的熟語を過剰に直訳してしまうのかを調査している。7つのヨーロッパ言語におけるエンコーダーとデコーダーのヘッドにおける注意パターンと隠れ表現を分析した結果、比喩的熟語は文脈との相互作用が低下した統合的語彙単位として処理されるが、それでもモデルは構成的出力を生成する傾向にある。主な貢献は、モデルの構成的インダクティブバイアスが非構成的処理を損なうことが特定されたことであり、熟語翻訳の改善にはアーキテクチャの変更が必要であると示唆している。

ABSTRACT

Unlike literal expressions, idioms' meanings do not directly follow from their parts, posing a challenge for neural machine translation (NMT). NMT models are often unable to translate idioms accurately and over-generate compositional, literal translations. In this work, we investigate whether the non-compositionality of idioms is reflected in the mechanics of the dominant NMT model, Transformer, by analysing the hidden states and attention patterns for models with English as source language and one of seven European languages as target language. When Transformer emits a non-literal translation - i.e. identifies the expression as idiomatic - the encoder processes idioms more strongly as single lexical units compared to literal expressions. This manifests in idioms' parts being grouped through attention and in reduced interaction between idioms and their context. In the decoder's cross-attention, figurative inputs result in reduced attention on source-side tokens. These results suggest that Transformer's tendency to process idioms as compositional expressions contributes to literal translations of idioms.

研究の動機と目的

  • TransformerベースのNMTモデルが、非構成的意味を持つにもかかわらずなぜ頻繁に熟語を直訳してしまうのかを調査すること。
  • Transformerのエンコーダーとデコーダーにおける隠れ状態と注意メカニズムに、熟語がどのように表現されているかを分析すること。
  • モデルの構成的インダクティブバイアスが、複数のヨーロッパ言語にまたがる熟語翻訳の正確性に悪影響を及えるかどうかを特定すること。
  • 隠れ表現への干渉が、モデルの構成的翻訳への傾向を因果的に変えることができるかどうかを評価すること。
  • NMTにおける熟語の非構成的処理を向上させるためのアーキテクチャ的改善の知見を提供すること。

提案手法

  • 著者らは単語語彙の英語コーパスを用い、モデルの翻訳を類義語行動に基づいて比喩的または直訳的とヒューリスティックにラベル付けした。
  • 解釈可能性技術を適用して、比喩的熟語表現(PIE)と直訳的熟語表現との間でエンコーダーの自己注意とデコーダーのクロス注意を比較した。
  • INLP(解釈可能な非線形プロービング)を用いて、熟語的意味がモデルの表現に線形に符号化されているかどうかを、熟語トークンの隠れ表現をプローブすることで評価した。
  • 複数のレイヤーにわたるエンコーダーの隠れ状態に対して干渉を施し、表現の変更が翻訳出力に与える因果的影響をテストした。
  • 人間による評価により、ヒューリスティックラベル付け手法の妥当性を検証し、類義語的翻訳が実際に比喩的であることを保証した。
  • 結果は7つのヨーロッパ言語にわたって分析され、研究結果の言語間一貫性を評価した。

実験結果

リサーチクエスチョン

  • RQ1エンコーダーにおける注意パターンは、比喩的熟語表現と直訳的熟語表現の間でどのように異なるか?
  • RQ2デコーダーは、比喩的熟語と直訳的熟語を翻訳する際、エンコーダー出力にどの程度依存しているか?
  • RQ3熟語的意味がモデルの隠れ表現に線形に符号化されており、干渉によって操作可能か?
  • RQ4モデルの構成的インダクティブバイアスは、熟語の非構成的翻訳の実現能力にどのように影響するか?
  • RQ5隠れ表現を変更するアーキテクチャ的干渉によって、モデルの直訳的翻訳への傾向を低減させることができるか?

主な発見

  • 比喩的熟語はエンコーダーで、内部の注意が強化され周囲の文脈との相互作用が低下する統合的語彙単位として処理される。
  • デコーダーは、比喩的熟語を翻訳する際、エンコーダー出力へのクロス注意が低下しており、意味の導出がより独立していることが示唆される。
  • INLPを用いた隠れ状態への干渉により、類義語的翻訳が減少し、構成的翻訳が増加した。成功率はスウェーデン語で27%、スペイン語で40%の範囲であった。
  • モデルの直訳的翻訳への傾向は強く、干渉後でも70%を超える熟語翻訳が単語対単語の翻訳のままであり、非構成的処理が弱いことが示された。
  • 隠れ表現における熟語的意味の検出は、高レイヤーでより顕著であり、非構成的処理がネットワークの後段に現れる可能性を示唆している。
  • 結果から、構成性を好む学習手法が熟語翻訳に悪影響を及える可能性があり、今後のNMT設計にあたっては注意が必要であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。