[論文レビュー] SWAG: A Large-Scale Adversarial Dataset for Grounded Commonsense Inference
本論文では、動画キャプションから抽出された113,000件の意味的根拠のある常識的推論例から成る大規模な敵対的データセット、Swagを紹介する。アドバーシャルフィルタリングを用いてアノテーションのアーティファクトを排除した。この手法は、言語モデルが生成する反事後的文(反例)とスタイル分類器の委員会を組み合わせることで、バイアスのない複数選択式の質問を生成し、人間の正確性は88%に達するが、最先端のモデルでは60%未塔にとどまることから、NLPシステムにおける顕著な課題を浮き彫りにしている。
Given a partial description like "she opened the hood of the car," humans can reason about the situation and anticipate what might come next ("then, she examined the engine"). In this paper, we introduce the task of grounded commonsense inference, unifying natural language inference and commonsense reasoning. We present SWAG, a new dataset with 113k multiple choice questions about a rich spectrum of grounded situations. To address the recurring challenges of the annotation artifacts and human biases found in many existing datasets, we propose Adversarial Filtering (AF), a novel procedure that constructs a de-biased dataset by iteratively training an ensemble of stylistic classifiers, and using them to filter the data. To account for the aggressive adversarial filtering, we use state-of-the-art language models to massively oversample a diverse set of potential counterfactuals. Empirical results demonstrate that while humans can solve the resulting inference problems with high accuracy (88%), various competitive models struggle on our task. We provide comprehensive analysis that indicates significant opportunities for future research.
研究の動機と目的
- NLPデータセットにおけるアノテーションのアーティファクトや人間のバイアスが、モデルが真の推論ではなくスタイル的ヒントに依存するのを防ぐこと。
- 意味的根拠のある常識的推論のための高品質でバイアスのないデータセットをスケーラブルかつ自動的に構築する方法を開発すること。
- 言語的含意をはるかに超えた物理的・状況的推論を要するため、最先端のモデルを挑戦するベンチマークを構築すること。
- 現在のモデルが意味的根拠のある常識的推論タスクにおいて、人間の高いパフォーマンスにもかかわらず顕著に苦戦することを示すこと。
提案手法
- ActivityNetおよびLSMDCから113,000件の動画キャプションペアを収集し、複数選択式推論用の文脈-動詞句ペアを形成する。
- 最新の言語モデルを微調整して、多様で妥当な反事後的(否定的)な動詞句の終りを大量にオーバースマplingする。
- アドバーシャルフィルタリング(AF)を適用:スタイル分類器のアンサンブルを訓練し、バイアスのある言語的パターンを持つ終りを特定・フィルタリングする。
- フィルタリング済みのデータを再トレーニングすることで、スタイル的アーティファクトを除去しながら意味的妥当性を維持するため、反復的にデータセットを精錬する。
- クラウドソーシングによる検証を通じて、最終的なフィルタリングされた反事後的文の品質と多様性を保証する。
- 各文脈に対して1つの正解と3つのバイアスのない、敵対的にフィルタリングされた反事後的文を含むバランスの取れたデータセットを構築する。
実験結果
リサーチクエスチョン
- RQ1アドバーシャルフィルタリングは、大規模な常識的推論データセットにおけるアノテーションのアーティファクトを効果的に低減できるか?
- RQ2Swagデータセットは、現在のNLPモデルが意味的根拠のある常識的推論においてどの程度の限界に直面しているかをどのように露呈するか?
- RQ3意味的根拠のある常識的推論における人間のパフォーマンスと最先端のモデルのパフォーマンスは、どのように比較されるか?
- RQ4言語モデルが生成する反事後的文を用いることで、推論データセットにおける否定的例のロバスト性と多様性が向上するか?
主な発見
- 人間はSwagデータセットで88%の正確性を達成しており、タスクの複雑さにもかかわらず直感的であることが示唆されている。
- 最先端のNLIモデルはSwagで60%未満の正確性を達成しており、人間のパフォーマンスと比べ顕著な性能格差があることが示された。
- アドバーシャルフィルタリングはスタイル的アーティファクトを効果的に低減したことが裏付けられており、複数の分類器が正解と誤りの選択肢を一貫して識別できないことが証明された。
- データセットは動詞とトピックの両方で高い多様性を示しており、特定の動詞が分布を支配していないため、現実世界の状況を広くカバーしていることが示唆された。
- 最高のパフォーマンスを示したモデル(ESIM+ELMo)ですら、高い信頼度で誤った答えを選択することが頻発しており、物理的妥当性についての推論に失敗していることが示された。
- Swagにおける動詞の累積分布はMultiNLIよりも歪みが小さいため、動画ベースであるにもかかわらず、より広いドメインカバレッジを有していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。