Skip to main content
QUICK REVIEW

[論文レビュー] Active Inference and Intentional Behaviour

Karl Friston, Tommaso Salvatori|arXiv (Cornell University)|Dec 6, 2023
Gene Regulatory Network Analysis被引用数 5
ひとこと要約

本稿では、意図的行動—潜在的状態空間の目的に基づく目標指向的行動—が、帰納的計画を介したアクティブな推論によって生じることを提案している。これは反応的行動や感受的行動とは区別される。in vitro神経細胞培養およびグリッドワールドベンチマークのシミュレーションを通じて、潜在的状態空間に直接的に目的を指定することで、自由エネルギー最小化を介した高速で効率的かつ長時間スパンの計画が可能となり、従来の報酬ベースの強化学習手法を凌駆することが示された。

ABSTRACT

Recent advances in theoretical biology suggest that basal cognition and sentient behaviour are emergent properties of in vitro cell cultures and neuronal networks, respectively. Such neuronal networks spontaneously learn structured behaviours in the absence of reward or reinforcement. In this paper, we characterise this kind of self-organisation through the lens of the free energy principle, i.e., as self-evidencing. We do this by first discussing the definitions of reactive and sentient behaviour in the setting of active inference, which describes the behaviour of agents that model the consequences of their actions. We then introduce a formal account of intentional behaviour, that describes agents as driven by a preferred endpoint or goal in latent state-spaces. We then investigate these forms of (reactive, sentient, and intentional) behaviour using simulations. First, we simulate the aforementioned in vitro experiments, in which neuronal cultures spontaneously learn to play Pong, by implementing nested, free energy minimising processes. The simulations are then used to deconstruct the ensuing predictive behaviour, leading to the distinction between merely reactive, sentient, and intentional behaviour, with the latter formalised in terms of inductive planning. This distinction is further studied using simple machine learning benchmarks (navigation in a grid world and the Tower of Hanoi problem), that show how quickly and efficiently adaptive behaviour emerges under an inductive form of active inference.

研究の動機と目的

  • 報酬関数ではなく、潜在的状態空間に目的を定義することによって、アクティブな推論における意図的行動を形式化すること。
  • 自由エネルギー最小化と予測コーディングを用いて、反応的行動、感受的行動、意図的行動を区別すること。
  • 帰納的計画が神経系のシミュレーションおよび古典的計画タスクにおいて、高速で効率的かつ目的指向の行動を可能にすることを実証すること。
  • 外部報酬が存在しない状況でも、in vitro神経細胞培養における自己証明的行動が自由エネルギー最小化によって生じることを検証すること。
  • 帰納的計画が長期的計画の包括的範囲と短期的推論の効率性を統合できることを示すこと。

提案手法

  • 神経ネットワークにおける自己組織化と学習を説明するため、エージェントを変分自由エネルギーの最小化としてモデル化すること。
  • Pongに類似したタスクにおけるin vitro神経細胞培養の行動を模倣するために、ネストされた自由エネルギー最小化プロセスを実装すること。
  • 目的の行動を、潜在的状態空間における望ましい終点として指定する帰納的計画によって定義すること。
  • 期待自由エネルギーを最小化する方策を計算するために、後向き帰納法を用いること。
  • グリッドワールドナビゲーションやハノイの塔問題といったベンチマークタスクに帰納的計画を適用すること。
  • 目的状態を将来的な潜在状態に対する明確な事前分布として扱うことで、計画を推論として形式化すること。

実験結果

リサーチクエスチョン

  • RQ1アクティブな推論フレームワーク内において、意図的行動を反応的行動や感受的行動から形式的に区別する方法は何か?
  • RQ2帰納的計画は、効率的で長時間スパンの目的指向的行動を可能にする上で、どのような役割を果たすか?
  • RQ3強化学習や外部報酬が存在しない状況でも、in vitro神経細胞培養は適応的かつ目的指向の行動を示せるか?
  • RQ4報酬ベースの手法と比較して、潜在的状態空間に目的を指定することで、計画の効率性がどのように向上するか?
  • RQ5自由エネルギー最小化は、生物学的および人工系における自己証明的行動や目的論的行動をどの程度説明できるか?

主な発見

  • in vitro神経細胞培養は、外部報酬や強化学習を用いずに、自由エネルギー最小化によってPongを自発的に学習した。
  • 反応的行動、感受的行動、意図的行動の区別は、自由エネルギー最小化の構造と帰納的計画の使用によって自然に生じる。
  • 帰納的計画により、ハノイの塔およびグリッドワールドタスクで最適解への迅速な収束が達成され、標準的なモデルフリーおよびモデルベースの強化学習を上回った。
  • 意図的行動は、最終的な潜在状態に対する明確な事前分布を用いた期待自由エネルギーの最小化として形式化され、長時間スパンの計画が可能になった。
  • このフレームワークは、驚きの最小化と確率的推論のみを用いて、複雑で目的指向の行動を達成できる仕組みを説明している。
  • 結果は、基本的認知および感受性が、明示的な報酬信号がなくても、神経系における自由エネルギー最小化から生じるという仮説を支持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。