[論文レビュー] Visual Agents as Fast and Slow Thinkers
FaST は、提案アダプタとセグメンテーションアダプタを統合することで、精度と解釈可能性を向上させ、80.8% の VQA 正答率と 48.7% の GIoU を達成する可視エージェントフレームワークを導入する。このフレームワークは、スイッチアダプタを用いて、高速(System 1)と遅速(System 2)の思考モードを動的に切り替えることで、視覚的タスクにおける推論を改善する。強力なベースラインを上回り、より高い耐障害性と hallucination の低減を実現する。
Achieving human-level intelligence requires refining cognitive distinctions between System 1 and System 2 thinking. While contemporary AI, driven by large language models, demonstrates human-like traits, it falls short of genuine cognition. Transitioning from structured benchmarks to real-world scenarios presents challenges for visual agents, often leading to inaccurate and overly confident responses. To address the challenge, we introduce FaST, which incorporates the Fast and Slow Thinking mechanism into visual agents. FaST employs a switch adapter to dynamically select between System 1/2 modes, tailoring the problem-solving approach to different task complexity. It tackles uncertain and unseen objects by adjusting model confidence and integrating new contextual data. With this novel design, we advocate a flexible system, hierarchical reasoning capabilities, and a transparent decision-making pipeline, all of which contribute to its ability to emulate human-like cognitive processes in visual intelligence. Empirical results demonstrate that FaST outperforms various well-known baselines, achieving 80.8% accuracy over VQA^{v2} for visual question answering and 48.7% GIoU score over ReasonSeg for reasoning segmentation, demonstrate FaST's superior performance. Extensive testing validates the efficacy and robustness of FaST's core components, showcasing its potential to advance the development of cognitive visual agents in AI systems. The code is available at ttps://github.com/GuangyanS/Sys2-LLaVA.
研究の動機と目的
- 現実世界の環境において、モデルが過信的で幻覚的な応答を生成する問題を是正すること。
- 明示的に System 1(高速で直感的)と System 2(遅速で熟考的)の思考をモデル化することで、人工知能と人間レベルの認知のギャップを埋めること。
- 不確実性、見えない対象、または複雑なクエリを含む視覚的タスクにおける推論の耐障害性を向上させること。
- 説明可能な中間出力を備えた透明で階層的な推論パイプラインを構築し、説明可能性を強化すること。
提案手法
- スイッチアダプタが、タスクの複雑さとモデルの信頼度に基づき、System 1 と System 2 のモードを動的に選択する。
- 単純なタスクで高い信頼度が得られた場合、System 1 が起動され、高速な推論が可能になる。
- 不確実性や見えない対象が検出された場合(例:曖昧なクエリや小さな物体)、負の文脈データを用いて信頼度を再キャリブレーションすることで、System 2 が活性化される。
- プロポーザルアダプタが、注目領域(RoI)の候補を生成し、詳細な分析を導く。
- セグメンテーションアダプタが、複雑なインスタンスにおける細粒度の推論のためのピクセル単位のマスクを出力する。
- 世界知識と文脈的手がかりを統合することで、証拠の連鎖を構築し、解釈可能性を高め、幻覚を低減する。
実験結果
リサーチクエスチョン
- RQ1視覚エージェントは、タスクの複雑さと不確実性に基づいて、どのように推論モードを動的に適応させるか?
- RQ2ハイブリッドな高速/遅速思考メカニズムは、視覚的質問応答やセグメンテーションにおいて、幻覚をどの程度低減できるか?
- RQ3文脈的手がかりとピクセル単位のアダプタは、未知または曖昧な視覚入力に対する推論の耐障害性を向上させる上で、果たす役割は何か?
- RQ4透明で神経的記号的推論パイプラインを統合することで、モデルの説明可能性と性能はどのように向上するか?
主な発見
- FaST は VQA-v2 で 80.8% の正答率を達成し、ベースラインモデルを顕著に上回る。
- ReasonSeg ベンチマークでは、48.7% の GIoU スコアを達成し、インスタンスレベルの推論とセグメンテーションの正確性が優れていることを示している。
- アブレーションスタディの結果、プロポーザルアダプタとセグメンテーションアダプタの両方が性能向上に寄与しており、併用することで最良の結果が得られた。
- スイッチアダプタに欠落した対象と文脈的手がかりを組み込むことで、MME と refCOCOg で最高で 5.6 ポイントのスコア向上が達成された。
- MME では純粋な System 2 推論と比較して約 31% 速く、GQA では 50% 速く動作し、高い性能を維持している。
- 定性的な結果では、FaST は LLaVA-v1.5 や LISA-7B よりもより正確で局所化され、説明可能な予測を生成しており、特に複雑または曖昧な状況下で顕著な優位性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。