[논문 리뷰] Unified Models of Human Behavioral Agents in Bandits, Contextual Bandits and RL
이 논문은 정신과적 및 신경학적 장애의 임상적 발견을 영감으로 삼아 보상 처리를 긍정적 및 부정적 스트림으로 분리함으로써 다수의 손잡이 밴딧, 컨텍스트 밴딧, 강화 학습 환경에서 인간 행동을 일관되게 모델링하는 통합적이고 매개변수 기반 프레임워크를 제안한다. 이 모델은 다양한 시뮬레이션 작업, 실제 도박 데이터, 그리고 보상의 정적/비정적 특성을 띤 팩맨 게임에서 경쟁적인 성능을 보이며 생물학적으로 타당한 다양한 행동을 구현한다.
Artificial behavioral agents are often evaluated based on their consistent behaviors and performance to take sequential actions in an environment to maximize some notion of cumulative reward. However, human decision making in real life usually involves different strategies and behavioral trajectories that lead to the same empirical outcome. Motivated by clinical literature of a wide range of neurological and psychiatric disorders, we propose here a more general and flexible parametric framework for sequential decision making that involves a two-stream reward processing mechanism. We demonstrated that this framework is flexible and unified enough to incorporate a family of problems spanning multi-armed bandits (MAB), contextual bandits (CB) and reinforcement learning (RL), which decompose the sequential decision making process in different levels. Inspired by the known reward processing abnormalities of many mental disorders, our clinically-inspired agents demonstrated interesting behavioral trajectories and comparable performance on simulated tasks with particular reward distributions, a real-world dataset capturing human decision-making in gambling tasks, and the PacMan game across different reward stationarities in a lifelong learning setting.
연구 동기 및 목표
- 다수의 손잡이 밴딧, 컨텍스트 밴딧, 강화 학습 환경에서 인간의 의사결정 행동을 일관되게 모델링하는 통합적 계산 프레임워크를 개발하는 것.
- 정신과적 및 신경학적 장애의 임상적 통찰을 이원적 보상 처리 메커니즘을 통해 순차적 의사결정 모델에 통합하는 것.
- ADHD, 우울증, 만성 통증 등 다양한 행동적 편향을 포괄할 수 있는 유연하고 매개변수화된 에이전트 가족을 만드는 것.
- 모델의 성능을 실제 인간의 의사결정 데이터와 보상 조건이 변화하는 복잡한 환경(예: 팩맨 게임)에서 평가하는 것.
- 신경과학 및 정신의학 분야에서 보상 처리 이상 현상을 연구할 수 있는 계산적으로 해석 가능한 도구를 제공하는 것.
제안 방법
- 보상 신호를 긍정적 보상과 부정적 처벌로 분리하여 독립적인 스트림으로 처리하며, 각각 별도의 매개변수를 가짐.
- 이중 스트림 입력을 고려한 컨텍스트 톰슨 샘플링(CoT)을 확장하여 긍정적 및 부정적 보상 스트림의 가중치를 독립적으로 조정할 수 있도록 함.
- 각 암호에 대한 보상 기대치에 대한 사후 분포를 유지하며, 이는 이원적 스트림 입력을 기반으로 베이지안 추론을 통해 업데이트됨.
- 정책은 사후 분포에서 샘플링을 통해 행동을 선택하며, 샘플링 분포는 긍정적 및 부정적 보상 스트림 간의 상대적 영향력에 의해 조절됨.
- 상태 및 컨텍스트 표현을 조정함으로써 MAB, CB, RL 환경 전반에 걸쳐 동일한 이원적 스트림 보상 메커니즘을 유지하면서 프레임워크를 적용함.
- 모델은 정적, 확률적 스케일링, 확률적 전환, 비정적 환경의 네 가지 보상 정적 조건에서 평가됨.
실험 결과
연구 질문
- RQ1통합적 매개변수 기반 모델이 다수의 손잡이 밴딧, 컨텍스트 밴딧, 강화 학습 환경에서 인간 행동 전략의 다양성을 포괄할 수 있는가?
- RQ2정신과적 장애에서 영감을 받은 이원적 보상 처리 메커니즘이 비정적 및 동적 환경에서 학습 성능에 어떤 영향을 미치는가?
- RQ3이 모델이 만성 통증에서 관찰되는 회피 행동이나 ADHD에서의 과도한 활동성과 같은 임상적으로 관찰된 행동을 어느 정도 재현할 수 있는가?
- RQ4표준 기준 모델 대비 보상 전환 또는 스케일링이 발생하는 환경에서 이원적 스트림 메커니즘이 성능 향상에 기여하는가?
- RQ5이 모델이 건강한 인구와 장애가 있는 인구 모두에서 보상 처리를 연구하는 일반적인 계산 도구로 활용될 수 있는가?
주요 결과
- 정적, 확률적 스케일링, 확률적 전환, 비정적 환경의 네 가지 보상 정적 조건 전반에서, 이원 분할 모델 에이전트는 LinUCB 및 SCTS와 같은 표준 기준 모델과 경쟁하는 성능을 기록함.
- 보상 전환 조건에서는 ADHD 유사한 빠른 전환 행동을 보이는 특정 정신적 에이전트가 표준 이원 모델을 초월하는 성능을 보였으며, 불안정한 환경에서의 적응적 행동과 임상 관찰 결과가 일치함.
- 만성 통증(CP) 유사 에이전트는 높은 보상이 가까이에 있음에도 불구하고 지속적으로 괴물에서 도망치는 극단적인 회피 행동을 보였으며, 통증 관련 행동 억제의 임상적 특성을 반영함.
- 모델은 다양한 행동 표현형을 성공적으로 재현함: CP 에이전트는 보상보다 생존을 우선시하는 반면, ADHD 유사 에이전트는 변화가 빠른 보상 구조에서 빛을 발함.
- GitHub 레포지토리의 비디오 데모는 장기적인 회피 및 보상 추구 감소와 같은 임상적 기대와 일치하는 에이전트 행동을 확인함.
- 실제 도박 데이터와 팩맨 게임을 포함한 다양한 환경에서 프레임워크의 강건성을 입증함으로써, 인간과 유사한 의사결정 모델링에 광범위한 적용 가능성을 시사함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.