[論文レビュー] MacGyver: Are Large Language Models Creative Problem Solvers?
この論文は、機能的固定化(物体を通常の役割以外に使わせることが制限される認知バイアス)の下で創造的問題解決をテストするための、1,683件の現実世界の問題からなる新規ベンチマーク「MacGyver」を紹介している。本研究では、物理的に妥当で独創的な解決策を生成する能力について、人間とLLM(GPT-4など)を評価し、LLMが物理的妥当性に欠け、過信傾向を示す一方で、反復的段階的想起や多様的・収束的思考といった新しいプロンプティング技法により改善可能であることが明らかになった。
We explore the creative problem-solving capabilities of modern LLMs in a novel constrained setting. To this end, we create MACGYVER, an automatically generated dataset consisting of over 1,600 real-world problems deliberately designed to trigger innovative usage of objects and necessitate out-of-the-box thinking. We then present our collection to both LLMs and humans to compare and contrast their problem-solving abilities. MACGYVER is challenging for both groups, but in unique and complementary ways. For instance, humans excel in tasks they are familiar with but struggle with domain-specific knowledge, leading to a higher variance. In contrast, LLMs, exposed to a variety of specialized knowledge, attempt broader problems but fail by proposing physically-infeasible actions. Finally, we provide a detailed error analysis of LLMs, and demonstrate the potential of enhancing their problem-solving ability with novel prompting techniques such as iterative step-wise reflection and divergent-convergent thinking. This work (1) introduces a fresh arena for intelligent agents focusing on intricate aspects of physical reasoning, planning, and unconventional thinking, which supplements the existing spectrum of machine intelligence; and (2) provides insight into the constrained problem-solving capabilities of both humans and AI.
研究の動機と目的
- 人間とAIにおける日常的創造的問題解決(Little-C創造性)を評価するための大規模かつ現実世界のデータセットの不足に対処すること。
- 現代の大型言語モデル(LLM)が、物体の使用を伝統的な役割に限定する認知バイアス・機能的固定化を克服できるかどうかを調査すること。
- 多様的思考と収束的思考を要する非常識な問題解決タスクにおいて、人間とLLMのパフォーマンスを比較すること。
- 反復的段階的想起や多様的・収束的思考といった新しいプロンプティング戦略が、LLMの推論力と物理的妥当性の向上にどの程度効果的であるかを評価すること。
- 人間とLLMの創造的問題解決能力の相補的強みを明らかにし、人間とAIの協働によるパフォーマンス向上の可能性を探ること。
提案手法
- 非自明な物体再利用を促すために、非常識な道具の使用を要する1,683件の自然言語問題シナリオを生成するための、人的リソースを効率化した反復的パイプラインを設計した。
- 人間による検証を通じて問題を収集・検証し、非自明で創造的な物体再利用を要する問題であることを保証した(例:ワインボトルをローリングピンとして使用)。
- 正解性と妥当性を保証するため、各問題に少なくとも1つの人間による検証済み解決策を関連付けた。
- ゼロショットおよびフェイシングショットプロンプティングを用いて、GPT-3.5、GPT-4、PaLM2、Claude2、Llama2の複数のLLMをベンチマークで評価した。
- 反復的段階的想起と多様的・収束的思考の2つの新しいプロンプティング技法を提案・検証し、LLMの推論能力を向上させた。
- 一般的なLLMの失敗要因を特定するための詳細な誤差分析を実施し、物理的に不適切または非効率な行動を提案する事例を特定した。

実験結果
リサーチクエスチョン
- RQ1現代のLLMは、機能的固定化を克服し、非常識な道具の使用を要する現実世界の問題をどの程度解けるか?
- RQ2日常的な文脈における独創的・非常識的思考を要する問題において、LLMは人間と比べてどの程度のパフォーマンスを示すか?
- RQ3物体の機能的特性や物理的妥当性を含む物理的推論タスクにおいて、LLMの主な失敗モードは何か?
- RQ4反復的段階的想起や多様的・収束的思考といった新しいプロンプティング戦略は、LLMの創造的問題解決タスクにおけるパフォーマンスを向上させられるか?
- RQ5人間とLLMの問題解決能力にはどのような相補的強みがあり、人間とAIの協働は全体のパフォーマンスをどのように向上させ得るか?
主な発見
- MacGyverデータセットの解ける問題の82%以上が、機能的固定化を克服する必要があるため、人間とLLMの両者にとって認知的に挑戦的である。
- GPT-4がLLMの中で最高のパフォーマンスを示し、問題の68.5%を正しく解いたが、依然として人間のベンチマークと比べて顕著に劣っていた。
- LLMは、過信した推論や捏造された物体の機能的特性に依存する際、物理的に不適切または非効率な解決策を頻繁に提案した。
- 人間はパフォーマンスのばらつきが大きかった:なじみのある問題では優れた成績を示したが、分野特有の知識の欠如により苦戦した。
- 提案されたプロンプティング技法(反復的段階的想起と多様的・収束的思考)は、LLMのパフォーマンスを顕著に向上させ、誤解を減らし、解決策の妥当性を高めた。
- 誤差分析から、LLMは解けない問題を認識できず、物理的経路が存在しないにもかかわらず、誤って解決策の生成を試みることが多いことが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。