[논문 리뷰] The relationship between dynamic programming and active inference: the discrete, finite-horizon case.
이 논문은 이산적이고 유한한 시간 범위를 가진 부분 관측 가능 마르코프 결정 과정(POMDP)에서 벨만 방정식에 기반한 동적 프로그래밍이 활동적 추론의 극한 사례임을 규명한다. 기대 자유 에너지를 최소화함으로써 활동적 추론는 보상 극대화와 불확실성 감소를 통합하며, 탐색적 행동과 이용적 행동이 단일 변분 추론 프레임워크에서 자연스럽게 유도됨을 드러낸다.
Active inference is a normative framework for generating behaviour based upon the free energy principle, a theory of self-organisation. This framework has been successfully used to solve reinforcement learning and stochastic control problems, yet, the formal relation between active inference and reward maximisation has not been fully explicated. In this paper, we consider the relation between active inference and dynamic programming under the Bellman equation, which underlies many approaches to reinforcement learning and control. We show that, on partially observable Markov decision processes, dynamic programming is a limiting case of active inference. In active inference, agents select actions to minimise expected free energy. In the absence of ambiguity about states, this reduces to matching expected states with a target distribution encoding the agent's preferences. When target states correspond to rewarding states, this maximises expected reward, as in reinforcement learning. When states are ambiguous, active inference agents will choose actions that simultaneously minimise ambiguity. This allows active inference agents to supplement their reward maximising (or exploitative) behaviour with novelty-seeking (or exploratory) behaviour. This clarifies the connection between active inference and reinforcement learning, and how both frameworks may benefit from each other.
연구 동기 및 목표
- 활동적 추론과 동적 프로그래밍 간의 형식적 관계를 순차적 결정 문제 맥락에서 명확히 하기.
- 상태의 불확실성이 없을 때 활동적 추론가 동적 프로그래밍으로 축소되는 조건을 조사하기.
- 기대 자유 에너지 최소화를 통해 활동적 추론이 보상 극대화와 탐색을 어떻게 자연스럽게 통합하는지 보여주기.
- 공통된 변분 추론 프레임워크 아래 강화 학습과 활동적 추론을 통합하기.
제안 방법
- 기대 자유 에너지의 최소화를 통해 믿음 상태에 대해 변분 추론 과정으로서 활동적 추론를 수립하기.
- 부분 관측 가능 마르코프 결정 과정(POMDP)에서 가치 함수를 모델링하기 위해 벨만 방정식 적용하기.
- 기대 자유 에너지 최소화가 기대 비용 최소화로 축소되는 조건 유도하기 (동적 프로그래밍과 동치).
- 상태 불확실성이 0일 때 자유 에너지 최소화가 표준 강화 학습에서 보상 극대화와 일치함을 보여주기.
- 모델 불확실성과 기대 비용을 동시에 최소화함으로써 애자일 탐색이 가능해지는 맥락에서, 불확실성이 존재할 경우 에 agen이 어떻게 행동하는지 보여주기.
- 자유 에너지 분해를 사용하여 활동적 추론가 에피스테믹 불확실성을 포함함으로써 동적 프로그래밍을 일반화함을 보여주기.
실험 결과
연구 질문
- RQ1유한 시간 범위의 POMDP에서 벨만 방정식 기반 동적 프로그래밍과 활동적 추론 간의 관계는 어떻게 되는가?
- RQ2활동적 추론가 동적 프로그래밍으로 축소되는 조건는 무엇인가?
- RQ3활동적 추론은 어떻게 단일 원칙적 프레임워크 안에서 보상 극대화와 탐색을 통합하는가?
- RQ4에피스테믹 불확실성은 활동적 추론 내에서 행동을 어떻게 형성하는가?
주요 결과
- 상태 불확실성이 미미할 경우 활동적 추론은 기대 비용 최소화를 위해 행동함으로써 동적 프로그래밍으로 축소된다.
- 불확실성이 없을 경우 기대 자유 에너지 최소화는 기대 보상 극대화와 동치이며, 표준 강화 학습과 일치한다.
- 상태가 모호할 경우 활동적 추론 에이전트는 기대 비용과 모델 불확실성을 동시에 최소화하여 내재적 탐색을 가능하게 한다.
- 이 프레임워크는 이용(보상 극대화)과 탐색(불확실성 감소)을 자연스럽게 균형 잡으며, 강화 학습의 두 핵심 행동을 통합한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.