[论文解读] Inverse Decision Modeling: Learning Interpretable Representations of Behavior
本文提出了逆决策建模(IDM),一种统一框架,通过形式化正向(规范性)与逆向(描述性)问题,实现对顺序决策行为的可解释、参数化表征。它展示了如何通过灵活性、乐观性与适应性等可解释参数,实现对有限理性行为的建模——涵盖决策复杂性、主观性与不确定性。
Decision analysis deals with modeling and enhancing decision processes. A principal challenge in improving behavior is in obtaining a transparent description of existing behavior in the first place. In this paper, we develop an expressive, unifying perspective on inverse decision modeling: a framework for learning parameterized representations of sequential decision behavior. First, we formalize the forward problem (as a normative standard), subsuming common classes of control behavior. Second, we use this to formalize the inverse problem (as a descriptive model), generalizing existing work on imitation/reward learning -- while opening up a much broader class of research problems in behavior representation. Finally, we instantiate this approach with an example (inverse bounded rational control), illustrating how this structure enables learning (interpretable) representations of (bounded) rationality -- while naturally capturing intuitive notions of suboptimal actions, biased beliefs, and imperfect knowledge of environments.
研究动机与目标
- 为透明刻画现实世界中不完美、有限理性的决策行为提供解决方案。
- 形式化一个通用的逆决策建模框架,统一并拓展现有的模仿学习与奖励学习方法。
- 实现对行为缺陷(如次优动作、偏见信念、有限环境知识)的可解释表征。
- 开发一种从观测行为中学习描述性参数(如灵活性、乐观性)的方法,而非假设规范性最优。
- 提供一种结构化、参数化的有限理性模型,支持对个体决策轨迹的可审计性与分析。
提出的方法
- 将正向问题形式化为规范性标准,通过广义规划算子涵盖最优控制与期望效用理论。
- 将逆向问题定义为描述性模型,利用对偶优化框架从观测行为中推断代理参数(如灵活性、乐观性)。
- 提出逆向有限理性控制(IBRC)作为具体实现,通过参数 α⁻¹(灵活性)、β⁻¹(乐观性)与 η⁻¹(适应性)建模具有有限理性的代理。
- 使用信念状态(z)作为主观动态的充分统计量,通过信念条件动作实现策略学习的马尔可夫化。
- 采用软策略匹配与KL散度最小化学习识别与规范策略,通过信念传播将问题简化为可处理的优化。
- 利用贝尔曼算子与价值函数收缩性确保逆向规划过程的稳定性与收敛性。
实验结果
研究问题
- RQ1我们如何正式表征并从观测决策序列中学习有限理性的参数?
- RQ2逆决策建模在多大程度上推广了现有的模仿学习与奖励学习框架?
- RQ3我们如何将行为缺陷(如次优动作或偏见信念)解释为对规范性模型的结构化偏离?
- RQ4信念状态与主观动态在实现不确定性下决策建模的可解释性中起到何种作用?
- RQ5该框架能否支持对现实决策的可审计性,例如临床诊断轨迹?
主要发现
- 逆向有限理性控制(IBRC)框架成功从观测行为中学习到可解释参数——灵活性(α⁻¹)、乐观性(β⁻¹)与适应性(η⁻¹),实现对有限理性的结构化建模。
- 该方法通过贝尔曼算子的收缩性实现稳定收敛,满足 ‖B V − B V′‖∞ ≤ γε,确保价值函数估计的鲁棒性。
- 信念单纯形中的信念轨迹(如阿尔茨海默病诊断)揭示了可解释的决策模式,例如因有限理性导致的延迟诊断。
- 该框架捕捉了直观的行为现象:例如,临床医生可能因决策复杂性或信念不确定性过高而避免开具MRI检查,即使理性策略会推荐该行为。
- 通过KL散度最小化的软策略匹配导致可处理的优化,熵项相互抵消,最终得到用于高效训练的公式24。
- 该方法推广了行为克隆与分布匹配,同时支持超越效用最大化的丰富分析——例如建模乐观性或风险敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。