Skip to main content
QUICK REVIEW

[論文レビュー] When Choosing Plausible Alternatives, Clever Hans can be Clever

Pride Kavumba, Naoya Inoue|arXiv (Cornell University)|Nov 1, 2019
Topic Modeling参考文献 23被引用数 5
ひとこと要約

この論文は、COPA共通認識推論ベンチマークにおける表面的でトークンレベルの手がかりが、BERTが真の理解なしに高い精度を達成できるようにしていることを特定する。バランス型COPA—これらの手がかりを中和するように鏡像化されたCOPA—を導入することで、BERTが手がかりのない難しい例に対しても依然として高い性能を示すことが示され、これはタスク学習の証左である。一方、RoBERTaは手がかりが存在してもそれ依存しないことを示しており、より強い一般化能力を示している。

ABSTRACT

Pretrained language models, such as BERT and RoBERTa, have shown large improvements in the commonsense reasoning benchmark COPA. However, recent work found that many improvements in benchmarks of natural language understanding are not due to models learning the task, but due to their increasing ability to exploit superficial cues, such as tokens that occur more often in the correct answer than the wrong one. Are BERT's and RoBERTa's good performance on COPA also caused by this? We find superficial cues in COPA, as well as evidence that BERT exploits these cues. To remedy this problem, we introduce Balanced COPA, an extension of COPA that does not suffer from easy-to-exploit single token cues. We analyze BERT's and RoBERTa's performance on original and Balanced COPA, finding that BERT relies on superficial cues when they are present, but still achieves comparable performance once they are made ineffective, suggesting that BERT learns the task to a certain degree when forced to. In contrast, RoBERTa does not appear to rely on superficial cues.

研究の動機と目的

  • BERTのCOPAにおける優れた性能が、真の共通認識推論ではなく表面的で手がかりを利用しているかどうかを調査すること。
  • 文脈とは無関係に正しい答えを予測できるトークンレベルの手がかりがCOPAデータセットに存在するか、その影響を分析すること。
  • 各代替肢が正解・不正解として等しく出現するように、元の例の鏡像を生成することで、トークン分布をバランスさせる「バランス型COPA」と呼ばれる変更されたベンチマークを開発すること。
  • BERT や RoBERTa などのモデルが、表面的で手がかりが除去された状態でも、元のタスクを学習できるかどうかを評価すること。
  • オリジナルCOPAとバランス型COPAにおけるモデルの挙動を比較し、ヒューリスティック依存性と真の推論の両者を評価すること。

提案手法

  • 微調整済みBERTに前提文を除いた2つの代替肢のみを提供することで、データセットのアブレーションを実施。これにより、不均衡なトークン分布のおかげでランダムより高い精度を達成していることが判明。
  • 「woman」や「mother」などの特定の単一トークンが、正解に頻出する表面的で手がかりとなることを同定。
  • バランス型COPAを構築:元のCOPA例ごとに、元の不正解の代替肢が正しくなるような新しい前提文を作成。これにより、各代替肢が正解・不正解として等しく出現するようにする。
  • BERT と RoBERTa をオリジナルCOPAおよびバランス型COPAで微調整し、手がかりが多い(容易)例と手がかりのない(困難)例における性能を比較。
  • 勾配ベースの感度分析を用いて、個々のトークンに対するモデルの感受性を測定。オリジナルデータとバランス型データで微調整されたモデルを比較。
  • 手がかりの生産性を定量的に評価し、バランス型COPAで微調整した後のモデルにおける手がかりに対する感受性の変化を分析し、手がかりの利用度を評価。

実験結果

リサーチクエスチョン

  • RQ1COPAにおける表面的でトークンレベルの手がかりが、BERTのようなモデルが真の因果関係推論タスクを理解しないままに高い精度を達成できるようにしているか?
  • RQ2BERTはどの程度そのような手がかりに依存しており、それらが中和された状態でも依然として高い性能を示せるか?
  • RQ3RoBERTaは、COPAに手がかりが存在する場合でも、それらに同様に依存する傾向を示すか?
  • RQ4表面的で手がかりが除去された状態、すなわちバランス型COPAにおいて、モデルは真の推論タスクを学習できるか?
  • RQ5なぜRoBERTaは困難な例においてBERTを上回り、手がかりが存在してもそれに対して感受性を示さないのか?

主な発見

  • BERTは、表面的で手がかりがある容易なCOPA例では83.9%の精度を達成するが、それらのない困難な例では71.9%に低下し、手がかりに強く依存していることが示された。
  • バランス型COPAで微調整したBERTは、オリジナルCOPAと同等の全体的な性能を維持しており、手がかりが中和された状態でもタスクを学習できていることが示唆された。
  • 勾配分析により、バランス型COPAで微調整したBERTは、オリジナルCOPAで微調整したBERTと比べて、高生産性の表面的で手がかり(例:「woman」、「mother」)に対して著しく感受性が低いことが判明した。
  • RoBERTaは、オリジナルCOPAに手がかりが存在しても、表面的で手がかりに対して顕著な感受性を示さず、それらを活用していないことが示された。
  • RoBERTaはバランス型COPAでオリジナルCOPAよりも高い性能を示しており、手がかりを除去することで性能が向上している可能性がある。これは、誤ったパターンに依存するのを減らしたためだと考えられる。
  • 結果から、BERTはCOPAで表面的で手がかりを活用しているが、強制的にそれらを排除された状態ではタスクを学習できる一方、RoBERTaは初期段階からより頑健にタスクを学習しているように見える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。