[論文レビュー] Neural Foundations of Mental Simulation: Future Prediction of Latent Representations on Dynamic Scenes
本研究では、動的で自然主義的な環境における将来状態の予測を目的とした感覚的・認知的モデルを訓練・評価することで、心的シミュレーションの神経基盤を調査している。その結果、プリマトゥスの神経動態と人間の行動エラーパターンを最もよく再現するのは、多様なエゴセントリックタスクで事前学習された動画基盤モデルの潜在空間で将来状態を予測するモデルに限られ、心的シミュレーションが物理的予測に最適化された再利用可能で動的な視覚表現に依存していることを示唆している。
Humans and animals have a rich and flexible understanding of the physical world, which enables them to infer the underlying dynamical trajectories of objects and events, plausible future states, and use that to plan and anticipate the consequences of actions. However, the neural mechanisms underlying these computations are unclear. We combine a goal-driven modeling approach with dense neurophysiological data and high-throughput human behavioral readouts to directly impinge on this question. Specifically, we construct and evaluate several classes of sensory-cognitive networks to predict the future state of rich, ethologically-relevant environments, ranging from self-supervised end-to-end models with pixel-wise or object-centric objectives, to models that future predict in the latent space of purely static image-based or dynamic video-based pretrained foundation models. We find strong differentiation across these model classes in their ability to predict neural and behavioral data both within and across diverse environments. In particular, we find that neural responses are currently best predicted by models trained to predict the future state of their environment in the latent space of pretrained foundation models optimized for dynamic scenes in a self-supervised manner. Notably, models that future predict in the latent space of video foundation models that are optimized to support a diverse range of sensorimotor tasks, reasonably match both human behavioral error patterns and neural dynamics across all environmental scenarios that we were able to test. Overall, these findings suggest that the neural mechanisms and behaviors of primate mental simulation are thus far most consistent with being optimized to future predict on dynamic, reusable visual representations that are useful for Embodied AI more generally.
研究の動機と目的
- 動的環境における柔軟な心的シミュレーションを支える神経系および行動系におけるインダクティブバイアスを特定すること。
- 最先端の機械学習モデルが、将来予測タスクにおいてプリマトゥスの前頭前皮質神経動態と人間の行動パターンを再現できるかどうかを評価すること。
- 心的シミュレーション中に遮蔽された物理的軌道の神経応答を予測するのに最も適したモデルアーキテクチャ、損失関数、事前学習手法を特定すること。
- 多様で高ばらつきのある環境およびトレーニング分布外の新規シナリオへのモデルの一般化性能を評価すること。
- 将来予測を潜在空間で学習したモデルが、入力から直接観測できない隠れた物理的状態変数を推論できるかどうかを調査すること。
提案手法
- ピxls単位またはオブジェクトスロットの目的関数を持つエンドツーエンド自己教師ありモデル、および静的または動的基盤モデルの潜在空間で将来を予測するモデルを含む、複数の感覚的・認知的ネットワーククラスを訓練・評価した。
- 部分的遮蔽付きのボールインターセプションタスク(Mental-Pong)中にプリマトゥス前頭前皮質からの高密度神経生理学的記録を用い、モデルの予測をベンチマーク化した。
- 数千回の比較を含む高スルーレットの人間行動データを用い、モデルの将来予測性能とエラーパターンを評価した。
- 視覚的に隠された状態変数(例:速度)を含む、真の環境状態変数とモデルの予測を比較することで、暗黙の物理的理解の有無をテストした。
- 剛体、ソフトボディ(ドレープ)、および複雑な相互作用を含む、Physionベンチマークの多様な動的シーンでモデルを評価した。
- 複数ステップにわたる予測のロールアウトを可能にするフォワードダイナミクスヘッドを用い、長時間予測の一般化性能を評価した。
実験結果
リサーチクエスチョン
- RQ1遮蔽された物理的軌道の心的シミュレーション中に、プリマトゥス前頭前皮質神経動態を最もよく予測するのはどのモデルアーキテクチャとトレーニング目的関数か?
- RQ2潜在空間で将来予測を学習したモデルは、入力から直接観測できない隠れた物理的状態変数(例:速度)を推論できるか?
- RQ3モデルは、トレーニング分布外の新規環境や高ばらつきのあるシナリオにどの程度一般化できるか?
- RQ4エゴセントリック動画データで事前学習された基盤モデルは、静的画像やピxls単位再構成で事前学習されたモデルよりも神経的・行動的応答を予測する上で優れているか?
- RQ5再利用可能で因子化され、オブジェクト中心の表現が、正確で生物学的に妥当な心的シミュレーションを可能にする役割を果たすか?
主な発見
- 遮蔽された物理的軌道の心的シミュレーション中に、プリマトゥスの神経動態と人間の行動エラーパターンをすべてのテスト環境で最もよく再現するのは、多様なエゴセントリックセンサモータータスクで事前学習された動画基盤モデルの潜在空間で将来状態を予測するモデルに限られる。
- ピxls単位再構成やオブジェクトスロット予測で学習したモデルは、スケーリングを重ねても一般化性能が高くならず、スケーリングそのものが心的シミュレーションに十分でないことを示唆している。
- 最も優れた性能を示したモデルは、明示的に学習されていなくても、隠れた物理的状態変数(例:速度)を正しく予測できており、暗黙の物理的理解が生じていることを示している。
- 基盤モデルの潜在空間は同等ではない:動的でエゴセントリックな動画データ(例:Ego4D)で事前学習されたモデルは、静的画像や非エゴセントリックデータで事前学習されたモデルよりも優れている。
- 神経データと最も一致するモデルクラスは、ソフトボディ「Drape」シナリオにおいても唯一一般化性能を示しており、他のすべてのモデルが著しく困難を抱える中で、唯一その状況をうまく処理している。
- 神経応答は、再利用可能で動的な潜在空間で将来状態を予測するように訓練されたモデルによって最もよく予測される。これは、心的シミュレーションがこのような表現をコアなインダクティブバイアスとして利用していることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。