Skip to main content
QUICK REVIEW

[論文レビュー] Back to Square One: Bias Detection, Training and Commonsense Disentanglement in the Winograd Schema

Yanai Elazar, Hongming Zhang|arXiv (Cornell University)|Apr 16, 2021
Topic Modeling参考文献 64被引用数 12
ひとこと要約

この論文は、Winograd Schema(WS)評価における深刻な欠陥を特定し、二重文評価法と二つの新しいベースラインを提案することで、データセットバイアスを露呈する。また、最先端の言語モデルがゼロショットのWSに類似したタスクにおいてランダムに動作することを示しており、WSベンチマークでの顕著な進歩は、真の常識的推論よりも教師ありデータのパターンに起因している可能性が高いことを示している。

ABSTRACT

The Winograd Schema (WS) has been proposed as a test for measuring commonsense capabilities of models. Recently, pre-trained language model-based approaches have boosted performance on some WS benchmarks but the source of improvement is still not clear. We begin by showing that the current evaluation method of WS is sub-optimal and propose a modification that makes use of twin sentences for evaluation. We also propose two new baselines that indicate the existence of biases in WS benchmarks. Finally, we propose a method for evaluating WS-like sentences in a zero-shot setting and observe that popular language models perform randomly in this setting. We conclude that much of the apparent progress on WS may not necessarily reflect progress in commonsense reasoning, but much of it comes from supervised data, which is not likely to account for all the required commonsense reasoning skills and knowledge.

研究の動機と目的

  • 現在のWinograd Schema評価手法に内在する欠陥を暴露し、モデルの能力を歪めて表現する可能性を解消すること。
  • 新しいベースラインモデルを用いて、既存のWSベンチマークに存在するバイアスを特定および定量化すること。
  • 二重文を用いた改良された評価フレームワークを提案し、より信頼性の高い常識的推論評価を実現すること。
  • 事前学習済み言語モデルがゼロショット設定において真に一般化された常識的推論を示しているかどうかを評価すること。

提案手法

  • Winograd Schemaベンチマークの信頼性を向上させるために、二重文評価法を提案する。
  • WSデータセットに存在する言語的および統計的バイアスを活用する二つの新しいベースラインを導入する。
  • ファインチューニングされたパターンを超えた一般化をテストするため、WSに類似した文に対するゼロショット評価プロトコルを設計する。
  • これらの手法を用いて、WSベンチマークでのパフォーマンス向上が常識的推論に起因するのか、それともデータ駆動のヒューリスティクスに起因するのかを評価する。
  • 標準的な事前学習済み言語モデル(例:BERT、RoBERTa)を新しい評価設定で用い、ゼロショットパフォーマンスを測定する。
  • 複数のWSバージョンにわたるモデルの予測を分析し、推論ではなく表面的な手がかりに依存しているかどうかを検出する。

実験結果

リサーチクエスチョン

  • RQ1現在のWinograd Schema評価手法は、どの程度モデルのデータセットバイアスへの依存を隠蔽しているのか?
  • RQ2新しいベースラインは、既存のWSベンチマークにおける体系的なバイアスを露呈できるか?
  • RQ3最先端の言語モデルは、ゼロショットのWSに類似した設定において真の常識的推論を示せるか?
  • RQ4WSベンチマークでの報告されたパフォーマンス向上の何パーセントが、推論ではなく教師ありデータのパターンに起因しているのか?
  • RQ5二重文を用いた改良された評価フレームワークは、常識的能力のより信頼性の高い評価を可能にするか?

主な発見

  • 標準的なWinograd Schema評価手法は最適ではなく、モデルバイアスを隠蔽する傾向がある。
  • 二つの新しいベースラインは、データセットバイアスを効果的に活用できており、現在のベンチマークがこのようなパターンに対して頑健でないことを示している。
  • 一般的に使用される事前学習済み言語モデルは、提案されたゼロショット評価設定においてランダムに動作する。これは、常識的推論の真の一般化が見られないことを示唆している。
  • WSベンチマークでの観察されたパフォーマンス向上は、主に教師ありデータのパターンに起因しており、真の常識的理解とは無関係である。
  • 二重文評価法は、曖昧さとバイアスを低減することで、常識的推論評価の信頼性を向上させている。
  • 本研究の結論として、WSベンチマークにおける多くの進歩は、常識的推論の進歩を反映しているのではなく、学習データからのインダクティブバイアスに起因していると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。