[논문 리뷰] Inverse Rational Control with Partially Observable Continuous Nonlinear Dynamics
이 논문은 연속적이고 비선형적이며 부분적으로 관찰 가능한 환경에서 비최적의 에이전트의 보상 함수와 내부 동역학 모델을 동시에 추론하는 새로운 프레임워크인 역합리적 제어(Inverse Rational Control, IRC)를 제안한다. 파arameterized된 모델 가족에 대해 베이지안 최적 제어 앙상블을 딥 강화학습을 통해 훈련함으로써, 기울기 상승을 통해 관측된 궤적의 가능도를 최대화하는 방법으로, 제한된 행동 데이터로부터 진정한 내부 모델 파라미터를 성공적으로 복원한다.
A fundamental question in neuroscience is how the brain creates an internal model of the world to guide actions using sequences of ambiguous sensory information. This is naturally formulated as a reinforcement learning problem under partial observations, where an agent must estimate relevant latent variables in the world from its evidence, anticipate possible future states, and choose actions that optimize total expected reward. This problem can be solved by control theory, which allows us to find the optimal actions for a given system dynamics and objective function. However, animals often appear to behave suboptimally. Why? We hypothesize that animals have their own flawed internal model of the world, and choose actions with the highest expected subjective reward according to that flawed model. We describe this behavior as <i>rational</i> but not optimal. The problem of Inverse Rational Control (IRC) aims to identify which internal model would best explain an agent's actions. Our contribution here generalizes past work on Inverse Rational Control which solved this problem for discrete control in partially observable Markov decision processes. Here we accommodate continuous nonlinear dynamics and continuous actions, and impute sensory observations corrupted by unknown noise that is private to the animal. We first build an optimal Bayesian agent that learns an optimal policy generalized over the entire model space of dynamics and subjective rewards using deep reinforcement learning. Crucially, this allows us to compute a likelihood over models for experimentally observable action trajectories acquired from a suboptimal agent. We then find the model parameters that maximize the likelihood using gradient ascent. Our method successfully recovers the true model of rational agents. This approach provides a foundation for interpreting the behavioral and neural dynamics of animal brains during complex tasks.
연구 동기 및 목표
- 기존의 역제어 방법이 연속적이고 비선형적이며 부분관측 가능한 시스템에서 보상과 동역학을 동시에 추론하지 못하는 격차를 보완하기 위해.
- 동물의 행동을 '합리적이지만 최적이 아닌' 것으로 모델링하기 위해 — 즉, 잘못된 내부 모델에 따라 최적화되지만 절대적인 의미에서의 비최적 행동으로서가 아니라.
- 관측 가능한 행동 궤적만으로도 은닉된 내부 모델(믿음과 주관적 동역학 포함)을 추론할 수 있는 확장 가능한 방법을 개발하기 위해.
- 기존의 역제어 기법을 상태와 행동 공간이 연속적이며, 비공개 센서 노이즈가 알려져 있지 않은 상황으로 확장하여 실제 신경과학 데이터에 적용 가능하게 하기 위해.
- 복잡하고 자연스러운 과제에서 신경 및 행동 역학을 해석하기 위한 내면 인지의 이론적 사고 유사 추론 기반의 토대를 마련하기 위해.
제안 방법
- 딥 강화학습을 사용해 전체 파라미터화된 작업 동역학과 주관적 보상 함수의 가족을 일반화하는 베이지안 최적 제어 앙상블을 훈련한다.
- 에이전트의 믿음 상태를 믿음 MDP로 표현하고, 제약 조건이 있는 추정기(예: 확장된 컨볼루션 필터)를 통해 믿음 갱신을 수행하여 제한된 합리성(bounded rationality)을 모델링한다.
- 관측 가능한 상태-행동 궤적에 대한 가능도 최대화 문제로 IRC 문제를 공식화하며, 관측되지 않은 감각 관측을 적분한다.
- 최대 가능도 추정(MLE)과 몬테카를로 기대값 최대화(MCEM)를 조합한 하이브리드 접근법을 사용해 모델 파라미터를 최적화한다.
- 에이전트의 추론된 내부 모델 하에서 관측된 궤적의 근사 로그 가능도를 최대화하기 위해 기울기 상승법을 적용한다.
- 물리 기반 모델을 사용해 작업 동역학과 보상 함수를 파arameterize함으로써, 공통적인 구조적 형태를 공유하는 관련 과제 간의 일반화를 가능하게 한다.
실험 결과
연구 질문
- RQ1연속적이고 비선형적이며 부분관측 가능한 환경에서 비최적 에이전트의 보상 함수와 내부 동역학 모델을 동시에 추론할 수 있는가?
- RQ2에이전트의 행동을 절대적인 의미에서의 비최적 행동이 아니라, 자신의 잘못된 내부 모델에 따라 합리적으로 행동하는 것으로 모델링할 수 있는가?
- RQ3관측 가능한 행동과 상태 궤적만으로도 은닉된 내부 모델 파라미터(믿음과 동역학 포함)를 가장 효과적으로 추론할 수 있는 방법은 무엇인가?
- RQ4제한된 행동 데이터와 알려지지 않은 비공개 센서 노이즈가 존재하는 상황에서도 내부 모델 파라미터를 정확하게 복원할 수 있는가?
- RQ5기존의 IRC 방법이 실패하는 고차원적이고 비선형적이며 연속적인 상태 및 행동 공간에 대해서도 이 방법은 어떻게 확장되는가?
주요 결과
- 제안된 IRC 프레임워크는 시뮬레이션된 에이전트의 진정한 내부 모델 파라미터를 성공적으로 복원하였으며, 모든 파라미터 차원에서 추정값이 기준값에 매우 가까운 것으로 나타났다.
- 합성 실험을 통해 제한된 행동 데이터 조건에서도 높은 정확도로 파라미터 복원을 달성하였으며, 진정한 모델로의 수렴이 관찰되었다.
- 로그 가능도 표면(그림 4B)은 명확한 전역 최대값으로 수렴하는 모습을 보이며, 가능도 목표 함수의 강력한 최적화를 시사한다.
- 기존의 IRL 또는 IOC 프레임워크에서 연속 비선형 시스템에 대해 구현되지 않은 바, 보상과 동역학을 동시에 추론하는 능력을 갖춘 점에서 기존 방법을 능가한다.
- 베이지안 최적 제어 앙상블의 사용으로 전체 모델 공간에 걸쳐 일반화가 가능해져, 다양한 작업 파라미터에 대한 가능도 계산이 가능해졌다.
- 이 프레임워크는 비공개 센서 노이즈가 존재하는 연속적이고 비선형적이며 부분관측 가능한 시스템에서 IRC 문제를 처음으로 해결한 것으로, 역제어 이론에서 중요한 격차를 메웠다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.