Skip to main content
QUICK REVIEW

[論文レビュー] Re-evaluating ADEM: A Deeper Look at Scoring Dialogue Responses

Ananya B. Sai, Mithun Das Gupta|arXiv (Cornell University)|Feb 23, 2019
Topic Modeling参考文献 30被引用数 8
ひとこと要約

この論文は、語順の反転などの単純なテキスト摂動によってスコアが操作可能な、神経ネットワークベースの自動対話応答評価モデル ADEM の脆弱性を、人間の判断と高い相関があると主張する一方で、平均 ~2.75、標準偏差 ~0.34 の極めて狭いスコアバンドを示し、多様な妥当な応答の評価においてその判別力が著しく低く、だまされやすいことから、信頼性に欠けることを批判的に評価している。

ABSTRACT

Automatically evaluating the quality of dialogue responses for unstructured domains is a challenging problem. ADEM(Lowe et al. 2017) formulated the automatic evaluation of dialogue systems as a learning problem and showed that such a model was able to predict responses which correlate significantly with human judgements, both at utterance and system level. Their system was shown to have beaten word-overlap metrics such as BLEU with large margins. We start with the question of whether an adversary can game the ADEM model. We design a battery of targeted attacks at the neural network based ADEM evaluation system and show that automatic evaluation of dialogue systems still has a long way to go. ADEM can get confused with a variation as simple as reversing the word order in the text! We report experiments on several such adversarial scenarios that draw out counterintuitive scores on the dialogue responses. We take a systematic look at the scoring function proposed by ADEM and connect it to linear system theory to predict the shortcomings evident in the system. We also devise an attack that can fool such a system to rate a response generation system as favorable. Finally, we allude to future research directions of using the adversarial attacks to design a truly automated dialogue evaluation system.

研究の動機と目的

  • 多様で妥当な応答のスコア付けにおいて、神経ネットワークベースの自動対話評価モデル ADEM の耐性および信頼性を調査すること。
  • ADEMのスコアリングメカニズムにおける設計上の欠陥を特定し、高品質と低品質の応答を区別する能力を制限する要因を明らかにすること。
  • ADEMのスコアが、さまざまな応答タイプにおいて人間の判断と意味的に相関しているかどうかを評価すること。
  • 標的の敵対的攻撃を設計・適用し、ADEMのスコアを最小限の入力摂動によって操作可能であることを示し、その脆弱性を実証すること。
  • 今後の研究が、より耐性があり、人間の判断と相関し、敵対的攻撃に強い対話評価システムの設計に向け導くこと。

提案手法

  • 線形システム理論に結びつけることで、ADEMのスコア関数の根本的な設計的制限を特定する体系的分析を実施した。
  • ガイドドバックプロパゲーションを用いたホワイトボックス敵対的攻撃により、ターゲットスコア(4.6–4.9)に近づくように応答埋め込みを最適化した。
  • 47万件のTwitter応答埋め込みデータベース内での最近傍探索をAnnoyインデックスを用いて実施し、高スコアの応答を近似した。
  • 全埋め込みデータベースを全走査するブルートフォースサーチを用いて、与えられた文脈におけるADEMスコアの理論的上限を同定した。
  • 直接スコア付けと再ランク付けを用いた人間評価を、ADEMのトップスコア応答に対して実施し、人間との相関を評価した。
  • 応答全体におけるADEMスコアの分布を分析し、平均2.75、標準偏差0.34の狭いバンドに集中していることが判明した。

実験結果

リサーチクエスチョン

  • RQ1語順の反転のような単純で意味的に妥当な摂動が、ADEMによる対話応答のスコアに顕著に影響を与えるか。
  • RQ2ADEMのスコア分布は人間の判断をどれほど反映しており、多様な妥当な応答において十分な判別力を持っているか。
  • RQ3ADEMは、意図的に高スコアまたは低スコアに設定された応答埋め込みを操作する標的の敵対的攻撃に対してどれほど脆弱か。
  • RQ4与えられた文脈におけるADEMスコアの上限は何か。また、最高スコアの応答の人間評価との比較は。
  • RQ5ADEMに対する敵対的攻撃を、より耐性があり、人間の判断と相関し、より強固な対話評価システムの設計に活用できるか。

主な発見

  • ADEMは非常に狭いスコア分散を示し、平均2.75、標準偏差0.34にとどまることから、多様な応答において判別力が著しく低いことが判明した。
  • 応答内の単純な語順反転が、人間の判断とは逆転した非直感的なスコアをADEMに与えることが判明し、微細な摂動に対して脆弱であることを示した。
  • ADEMのトップスコア応答の人間平均評価は5段階中1.9にとどまり、ADEMスコアと人間の質の認識との間には顕著な乖離があることが示された。
  • Annoyインデックスを用いた最近傍探索により、ADEMスコアは平均0.87向上し、平均3.62に達した。これは、モデルの意思決定境界における利用可能なギャップを示唆した。
  • 全埋め込みデータベースに対するブルートフォースサーチにより、平均スコアは3.93に上昇した。これは、ADEMが通常の応答で達成するスコアよりもはるかに高い理論的上限に達可能であることを示した。
  • 分析から、ADEMの乗法的相互作用メカニズムが埋め込みの高きつめの円錐性を生じさせ、これがスコア分散の制限を根本的に行い、応答の質の区別能力を損なう要因であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。