Skip to main content
QUICK REVIEW

[論文レビュー] A Pilot Evaluation of ChatGPT and DALL-E 2 on Decision Making and Spatial Reasoning

Zhisheng Tang, Mayank Kejriwal|arXiv (Cornell University)|Feb 15, 2023
Explainable Artificial Intelligence (XAI)被引用数 6
ひとこと要約

本パイロット研究では、非敵対的で中立的なプロンプトを用いて、ChatGPT と DALL-E 2 の意思決定の合理性と空間的推論能力を評価した。DALL-E 2 は空間的推論プロンプトごとに少なくとも1つの正しい画像を生成したが、物体の参照を理解しているにもかかわらず、しばしば誤った出力を示した。一方、ChatGPT は一貫性のない合理性を示し、複雑な問題では正しい推論を示したものの、ボン・ネウマン=モルゲンシュテルンの公理を多くの場合に違反した。

ABSTRACT

We conduct a pilot study selectively evaluating the cognitive abilities (decision making and spatial reasoning) of two recently released generative transformer models, ChatGPT and DALL-E 2. Input prompts were constructed following neutral a priori guidelines, rather than adversarial intent. Post hoc qualitative analysis of the outputs shows that DALL-E 2 is able to generate at least one correct image for each spatial reasoning prompt, but most images generated are incorrect (even though the model seems to have a clear understanding of the objects mentioned in the prompt). Similarly, in evaluating ChatGPT on the rationality axioms developed under the classical Von Neumann-Morgenstern utility theorem, we find that, although it demonstrates some level of rational decision-making, many of its decisions violate at least one of the axioms even under reasonable constructions of preferences, bets, and decision-making prompts. ChatGPT's outputs on such problems generally tended to be unpredictable: even as it made irrational decisions (or employed an incorrect reasoning process) for some simpler decision-making problems, it was able to draw correct conclusions for more complex bet structures. We briefly comment on the nuances and challenges involved in scaling up such a 'cognitive' evaluation or conducting it with a closed set of answer keys ('ground truth'), given that these models are inherently generative and open-ended in responding to prompts.

研究の動機と目的

  • 生成的 AI モデル、特に ChatGPT と DALL-E 2 の意思決定および空間的推論における認知的能力を評価すること。
  • これらのモデルが、フォン・ニューマン=モルゲンシュテルンの効用理論に基づく合理的意思決定の原則を、どの程度遵守しているかを評価すること。
  • 記述的プロンプトを用いて、空間的配置の正確な視覚的表現の能力を評価する DALL-E 2 の信頼性と一貫性を検討すること。
  • 生成的でオープンエンドな性質を持つこれらのモデルの認知的評価をスケーリングする際の課題を明らかにすること。

提案手法

  • 偏見やだましの意図がないように、意思決定と空間的推論を評価するための中立的で非敵対的なプロンプトを構築した。
  • ChatGPT の意思決定出力の評価基準として、フォン・ニューマン=モルゲンシュテルンの合理性公理(完全性、推移性、独立性、連続性)を用いた。
  • DALL-E 2 の空間的配置の視覚的表現能力を評価するため、記述的でオブジェクトレベルのプロンプトを用いた。
  • モデル出力の正しさ、一貫性、意図された推論または視覚的構造との整合性を評価するため、事後的な定性的分析を実施した。
  • 生成的かつオープンエンドな性質のため、事前に定義された正解(「真値」)を避けて評価を行った。
  • 単純から複雑な意思決定および空間的推論問題まで、複数の複雑度レベルで両モデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1DALL-E 2 は、空間的関係の誤解の可能性があるにもかかわらず、空間的推論プロンプトに対して正確な視覚的表現をどの程度生成できるか?
  • RQ2ChatGPT は、さまざまな意思決定状況において、フォン・ニューマン=モルゲンシュテルンの合理性公理にどの程度一貫して従っているか?
  • RQ3なぜ一部の ChatGPT の出力は、複雑なベットにおいて正しい結論を導く一方で、単純な問題では非合理的な推論を示すのか?
  • RQ4生成的モデルの認知的評価をスケーリングする際、その生成的で非決定的である応答パターンによって生じる課題は何か?
  • RQ5固定された「真値」が存在しない場合、生成的 AI の認知的タスクにおける評価の信頼性と妥当性にどのような影響が生じるか?

主な発見

  • DALL-E 2 は、各空間的推論プロンプトに対して少なくとも1つの正しい画像を生成した。これは、物体の配置や空間的関係の理解が機能的に行われていることを示している。
  • しかし、DALL-E 2 が生成した画像の多くは誤りであり、物体が正しく特定されていても、空間的配置の誤解が頻発していることが示された。
  • ChatGPT は、フォン・ニューマン=モルゲンシュテルンの合理性公理への一貫性のない適合を示し、多くの意思決定状況で少なくとも1つの公理に違反した。
  • モデルの推論は予測不能であった:単純な問題では非合理的な意思決定を下したが、より複雑なベット構造では正しい結論に至った。
  • ChatGPT の出力は、正しい答えに至ったとしても、誤った推論プロセスを用いる傾向にあり、一貫した内部論理の欠如を示している。
  • 本研究は、大規模言語モデルや拡散モデルの本質的な生成的・オープンエンドな性質に起因する、認知的評価のスケーリングにおける顕著な課題を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。