[論文レビュー] A Theoretically Grounded Benchmark for Evaluating Machine Commonsense
この論文は、Gordon-Hobbsの一般常識意味論理論に裏付けられた、機械一般常識推論(CSR)を評価するための最初のベンチマークである理論的根拠を持つ一般常識推論(TG-CSR)を紹介する。このベンチマークは、時間、空間、感情、目的などの9つの意味的カテゴリーにまたがる、少サンプルで文脈およびテーマに特化した質疑応答タスクを用い、段階的で徐々に難易度が上がるリリースにより過学習を防ぎ、厳密な意味的評価を可能にする。初期の結果では、大規模言語モデルですら統計的パターンを超えた意味的厳密性に苦戦していることが示された。
Programming machines with commonsense reasoning (CSR) abilities is a longstanding challenge in the Artificial Intelligence community. Current CSR benchmarks use multiple-choice (and in relatively fewer cases, generative) question-answering instances to evaluate machine commonsense. Recent progress in transformer-based language representation models suggest that considerable progress has been made on existing benchmarks. However, although tens of CSR benchmarks currently exist, and are growing, it is not evident that the full suite of commonsense capabilities have been systematically evaluated. Furthermore, there are doubts about whether language models are 'fitting' to a benchmark dataset's training partition by picking up on subtle, but normatively irrelevant (at least for CSR), statistical features to achieve good performance on the testing partition. To address these challenges, we propose a benchmark called Theoretically-Grounded Commonsense Reasoning (TG-CSR) that is also based on discriminative question answering, but with questions designed to evaluate diverse aspects of commonsense, such as space, time, and world states. TG-CSR is based on a subset of commonsense categories first proposed as a viable theory of commonsense by Gordon and Hobbs. The benchmark is also designed to be few-shot (and in the future, zero-shot), with only a few training and validation examples provided. This report discusses the structure and construction of the benchmark. Preliminary results suggest that the benchmark is challenging even for advanced language representation models designed for discriminative CSR question answering tasks. Benchmark access and leaderboard: https://codalab.lisn.upsaclay.fr/competitions/3080 Benchmark website: https://usc-isi-i2.github.io/TGCSR/
研究の動機と目的
- 機械一般常識推論(CSR)を意味的に厳密に評価する理論的根拠に基づくベンチマークの欠如を是正すること。
- 真の意味的理解を捉えきれない、一時的な統計的バイアスを伴うCSRベンチマークの限界を克服すること。
- データを4段階に段階的に難易度を上げてリリースすることで、過学習を防ぐベンチマークを設計すること、最終段階ではゼロショットフェーズを含むこと。
- Gordon-Hobbs理論に由来する形式的でオントロジーに基づく一般常識カテゴリーの分類法を確立し、質問と回答の構築をガイドすること。
- コンペティション形式のランク付きリーダーボードを通じて、持続可能な公開評価を可能にし、長期的なベンチマーク評価とモデル開発を支援すること。
提案手法
- ベンチマークは、Gordon-Hobbs理論の特定の意味的カテゴリー(例:『感情』や『時間』)に基づいた少サンプル質疑応答(QA)タスクとして構造化されている。
- 各QAインスタンスは、文脈(例:『海外へのバケーションを計画している』)とテーマ(例:『遅延したフライト』)に関連付けられており、質問の文脈的根拠を提供している。
- 質問は、意味的整合性を保ち、アノテーションの曖昧さを低減するため、9つのコア一般常識カテゴリーの形式的分類法に基づいて構築されている。
- ベンチマークは4段階に分けてリリースされる:最初の段階ではラベル付きの訓練・検証・テストセットを含むが、以降の段階では徐々に訓練データを減らし、最終段階ではラベル付き例のないゼロショットフェーズに至る。
- 生成型言語モデルのゼロショット評価にはプロンプトテンプレートが用いられ、回答は正解選択肢との完全一致または類似一致によって評価される。
- 生成された回答は、事前に定義された選択肢と一致しなくても、妥当性と意味的カテゴリーとの整合性について人的レビューで評価される。
実験結果
リサーチクエスチョン
- RQ1形式的な一般常識意味論理論に基づくベンチマークは、一時的なベンチマークに比べ、機械一般常識推論の評価をより厳密かつ信頼性高く行えるか?
- RQ2『感情』や『スケジューリング』のようなカテゴリーに意味的根拠を持つ質問は、純粋に統計的パターンマッチングと比較してモデルのパフォーマンスにどのように影響するか?
- RQ3大規模言語モデルは、TG-CSRのような意味的根拠に基づくベンチマークにおいて、統計的キューにとどまらず一般化できない程度にどれほど失敗するか?
- RQ4生成型言語モデルは、事前に定義された選択肢が提示されていなくても、妥当で人間らしい回答を出力できるか?また、それらの回答は正解の意味的カテゴリーとどの程度一致するか?
- RQ5段階的リリース戦略(最終段階にゼロショットフェーズを含む)は、過学習を防ぎ、モデルがデータセット固有の特徴に依存するのではなく意味的理解に依存するようにするのにどの程度有効か?
主な発見
- TG-CSRベンチマークは、Gordon-Hobbsの意味的カテゴリーに特化した形式的理論に基づいて、質疑応答インスタンスを体系的に根拠づける最初のベンチマークである。
- 数十億パラメータを持つ言語モデルですら、TG-CSRにおいて人間の水準に著しく劣っていることが示され、現在のモデルが意味的理解ではなく統計的キューに依存している可能性を示唆している。
- 生成モデルは、事前に定義された選択肢にない妥当な回答を頻繁に出力するため、生成モデルを回答拡張やデータ拡張に活用する可能性がある。
- 人間のアノテーターが『Yes』と判断した回答の多くが、モデル出力では『No』とラベル付けされたことがあり、少サンプル設定下でのモデル推論に体系的なバイアスが存在することが示された。
- 最終段階にゼロショットフェーズを含む段階的リリース戦略は、過学習を効果的に緩和し、モデルが訓練データを記憶するのではなく意味的パターンを学習するように促進した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。