[論文レビュー] The relationship between dynamic programming and active inference: the discrete, finite-horizon case.
この論文は、動的計画法が、部分的に観測可能なマルコフ意思決定過程(POMDP)における有限時間枠組みで、ベルマン方程式に従うものであると確立している。期待自由エネルギーを最小化することで、アクティブインファレンスは報酬最大化と曖昧さ低減を統合し、探索的行動と効果的行動が単一の変分推論フレームワークから自然に生じることを明らかにする。
Active inference is a normative framework for generating behaviour based upon the free energy principle, a theory of self-organisation. This framework has been successfully used to solve reinforcement learning and stochastic control problems, yet, the formal relation between active inference and reward maximisation has not been fully explicated. In this paper, we consider the relation between active inference and dynamic programming under the Bellman equation, which underlies many approaches to reinforcement learning and control. We show that, on partially observable Markov decision processes, dynamic programming is a limiting case of active inference. In active inference, agents select actions to minimise expected free energy. In the absence of ambiguity about states, this reduces to matching expected states with a target distribution encoding the agent's preferences. When target states correspond to rewarding states, this maximises expected reward, as in reinforcement learning. When states are ambiguous, active inference agents will choose actions that simultaneously minimise ambiguity. This allows active inference agents to supplement their reward maximising (or exploitative) behaviour with novelty-seeking (or exploratory) behaviour. This clarifies the connection between active inference and reinforcement learning, and how both frameworks may benefit from each other.
研究の動機と目的
- アクティブインファレンスと動的計画法の間の形式的関係を、順序的な意思決定において明確化すること。
- 状態の曖昧さが存在しない場合に、アクティブインファレンスがどのように動的計画法に還元されるかを調査すること。
- 期待自由エネルギーの最小化を通じて、報酬最大化と探索がどのようにアクティブインファレンスによって自然に統合されるかを示すこと。
- 共通の変分推論フレームワークの下で強化学習とアクティブインファレンスを統一すること。
提案手法
- 期待自由エネルギーを信念状態上で最小化する変分推論プロセスとしてアクティブインファレンスを形式化すること。
- 部分的に観測可能なマルコフ意思決定過程(POMDP)における価値関数をモデル化するためにベルマン方程式を適用すること。
- 期待自由エネルギーの最小化が期待コストの最小化に還元される条件を導出すること。これは動的計画法に等価である。
- 状態の不確実性がゼロの場合、自由エネルギーの最小化が標準的な強化学習における報酬最大化と一致することを示すこと。
- 曖昧性が存在する場合、エージェントが期待コストとモデルの不確実性の両方を最小化することにより、内発的探索が可能になることを示すこと。
- 自由エネルギー分解を用いて、アクティブインファレンスがエピステミック不確実性を含むことで、動的計画法を一般化していることを示すこと。
実験結果
リサーチクエスチョン
- RQ1有限時間枠組みのPOMDPにおいて、ベルマン方程式に従うアクティブインファレンスと動的計画法の関係は何か?
- RQ2アクティブインファレンスがどのように動的計画法に還元されるかの条件は何か?
- RQ3アクティブインファレンスは、どのように一貫したフレームワーク内で報酬最大化と探索を統合するか?
- RQ4エピステミック不確実性は、アクティブインファレンスにおける行動の形成にどのような役割を果たすか?
主な発見
- 状態の不確実性が無視できるほど小さい場合、アクティブインファレンスは動的計画法に還元され、エージェントは期待コストを最小化するために行動する。
- 曖昧さが存在しない場合、期待自由エネルギーの最小化は期待報酬の最大化と等価であり、標準的な強化学習と一致する。
- 状態が曖昧な場合、アクティブインファレンスエージェントは期待コストとモデルの不確実性の両方を最小化し、内発的探索を実現する。
- このフレームワークは、自然に報酬最大化(利用)と曖昧さ低減(探索)のバランスをとるため、強化学習の2つの核心的行動を統合する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。