Skip to main content
QUICK REVIEW

[論文レビュー] Benchmarks for Automated Commonsense Reasoning: A Survey

Ernest Davis|arXiv (Cornell University)|Feb 9, 2023
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

この論文は、テキスト、画像、動画、およびシミュレーテッド環境をカバーする139の一般常識推論ベンチマークを調査し、設計および評価における深刻な欠陥を特定している。本論文は、事典的知識ではなく、時間的・空間的・物理的・心理的・社会的といった基礎的推論に焦点を当てた、より高品質なベンチマークの導入を提唱するとともに、厳密なキュレーション、多言語テスト、倫理的なデータ実践を推進し、AIの一般常識的能力を信頼できる方法で測定することを求める。

ABSTRACT

More than one hundred benchmarks have been developed to test the commonsense knowledge and commonsense reasoning abilities of artificial intelligence (AI) systems. However, these benchmarks are often flawed and many aspects of common sense remain untested. Consequently, we do not currently have any reliable way of measuring to what extent existing AI systems have achieved these abilities. This paper surveys the development and uses of AI commonsense benchmarks. We discuss the nature of common sense; the role of common sense in AI; the goals served by constructing commonsense benchmarks; and desirable features of commonsense benchmarks. We analyze the common flaws in benchmarks, and we argue that it is worthwhile to invest the work needed ensure that benchmark examples are consistently high quality. We survey the various methods of constructing commonsense benchmarks. We enumerate 139 commonsense benchmarks that have been developed: 102 text-based, 18 image-based, 12 video based, and 7 simulated physical environments. We discuss the gaps in the existing benchmarks and aspects of commonsense reasoning that are not addressed in any existing benchmark. We conclude with a number of recommendations for future development of commonsense AI benchmarks.

研究の動機と目的

  • 既存のAI一般常識推論ベンチマークの状況を体系的に調査・分析すること。
  • AIシステムの一般常識的推論能力を信頼できる方法で測定するのを損なう、ベンチマーク設計における深刻な欠陥を特定すること。
  • 一般的な知識や専門的知識ではなく、基礎的一般常識的推論に焦点を当てた、より高品質なベンチマークの導入を提唱すること。
  • キュレーション、多言語テスト、倫理的なデータ取り扱いを含む、ベンチマーク作成のベストプラクティスを提案すること。
  • ベンチマークのパフォーマンスと実際の人間のような理解との間の不一致を解決すること。

提案手法

  • テキスト(102)、画像(18)、動画(12)、シミュレーテッド物理環境(7)の4つのモodalitiyにまたがる139のベンチマークを調査。
  • 既存ベンチマークにおける設計上の欠陥(曖昧な質問、極端に単純な推論、パズルのような構造)を分析。
  • ベンチマークの目的、望ましい特性、構築手法を評価し、一貫性と代表性の重要性を強調。
  • 代表的サンプリング、最小限の欠陥、多様な推論タイプの組み込みを含む、高品質ベンチマークの基準を提唱。
  • 例の透明性、欠陥の報告、サンプルデータセットのレビューを通じて、ベンチマーク作成者およびレビュアーによる品質管理の強化を推奨。
  • AI推論が言語に依存しているのか、それとも言語のパターンに依存しているのかを検証するため、多言語ベンチマークの導入を提唱。

実験結果

リサーチクエスチョン

  • RQ1既存の一般常識推論ベンチマークの設計および評価における主な欠陥は何か?
  • RQ2現在のベンチマークは、真の基礎的一般常識的推論をどれだけ測定しているのか、それとも表面的な知識やパターンマッチングにとどまっているのか?
  • RQ3AIシステムの信頼できるかつ意味のある評価を保証するため、どのようにしてベンチマークの品質を体系的に改善できるか?
  • RQ4人間が設計したパズルやテストをAIシステムのベンチマークとして使用するのはなぜ問題なのか?
  • RQ5AI一般常識的推論の強度と一般化能力を評価するにあたり、多言語評価はどのような役割を果たすべきか?

主な発見

  • 100以上ものベンチマークが開発されているが、多くの場合、曖昧な質問、極端に単純な推論、パズルのような構造といった深刻な欠陥を抱えている。
  • 多くのベンチマークが、よく知られた頭の体操や発達心理学のパズルに依存しており、大規模言語モデルがそれらを記憶している可能性があるため、真の推論ではなく記憶に基づいた回答がなされるおそれがある。
  • 多くのベンチマークは、時間的・空間的・物理的・心理的・社会的推論といった基礎的一般常識的推論を十分にテストしておらず、一般的な知識や事典的知識に焦点を当てている。
  • 本論文は、現在のベンチマークが実際の理解の代替指標として信頼できないことが判明しており、これによりAI研究および評価が誤った方向に導かれるおそれがある。
  • レビューアーや研究コミュニティは、特に学術論文で使用されている場合に、欠陥のあるベンチマークを特定・警告する役割をより強く果たすべきである。
  • 特に、無報酬の人的労働から得られたデータが、適切な拒否メカニズムなしにトレーニングデータとして使用される場合、倫理的懸念が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。