[论文解读] Towards Resolving Unidentifiability in Inverse Reinforcement Learning
本文通过引入一种主动的、多环境实验框架,解决了逆强化学习(IRL)中奖励函数的根本不可识别性问题。通过允许学习者在多个环境中选择并观察行为,作者证明了实验不可识别性——即多个奖励函数可解释同一策略——仅需 O(log d) 个环境即可消除,从而通过一种贪婪主动学习算法实现近乎完美的奖励恢复,该算法以最大化信息增益为目标。
We consider a setting for Inverse Reinforcement Learning (IRL) where the learner is extended with the ability to actively select multiple environments, observing an agent's behavior on each environment. We first demonstrate that if the learner can experiment with any transition dynamics on some fixed set of states and actions, then there exists an algorithm that reconstructs the agent's reward function to the fullest extent theoretically possible, and that requires only a small (logarithmic) number of experiments. We contrast this result to what is known about IRL in single fixed environments, namely that the true reward function is fundamentally unidentifiable. We then extend this setting to the more realistic case where the learner may not select any transition dynamic, but rather is restricted to some fixed set of environments that it may try. We connect the problem of maximizing the information derived from experiments to submodular function maximization and demonstrate that a greedy algorithm is near optimal (up to logarithmic factors). Finally, we empirically validate our algorithm on an environment inspired by behavioral psychology.
研究动机与目标
- 解决逆强化学习(IRL)中奖励函数不可识别的根本问题,该问题限制了从单环境观测中进行奖励推理的准确性。
- 区分表示不可识别性(例如常数或缩放后的奖励)与实验不可识别性(由于行为数据不足而无法区分奖励函数),并论证后者可通过主动实验消除。
- 提出一种新型 IRL 框架,其中学习者可主动选择多个环境以观察智能体行为,从而在识别保证方面优于传统单环境 IRL 方法。
- 设计并分析一种贪婪主动学习算法,以在实际约束下最大化关于真实奖励函数的信息增益。
- 在心理学启发的迷宫环境中对方法进行实证验证,结果表明其在奖励恢复性能上显著优于非自适应和单环境 IRL 基线方法。
提出的方法
- 本文提出一种模型,学习者可在固定状态-动作空间内选择任意转移动态,从而通过少量实验实现奖励函数的完全识别。
- 将最小化实验不可识别性的问题建模为活动子模函数最大化问题,目标是减少与奖励函数一致的集合体积。
- 提出一种贪婪算法,按顺序选择环境,理论上保证其解在减少一致奖励函数集合体积方面,与最优解相差一个对数因子,即使在预算受限条件下也成立。
- 该算法使用带 L2 正则化的线性规划方法,从所选环境中观察到的一系列一致策略中估计奖励函数。
- 在两种设置下评估该方法:策略观测(完整最优策略被观测到)和轨迹观测(仅部分轨迹可用),结果均显示性能一致提升。
- 该方法利用 MCMC 采样(hit-and-run)技术估算一致奖励集合的体积,并从高维凸集(代表可能的奖励)中进行采样。
实验结果
研究问题
- RQ1通过主动选择多个环境,能否完全解决 IRL 中的实验不可识别性问题?
- RQ2在理论最优设置下,实现近乎完美的奖励恢复所需的最少环境数量是多少?
- RQ3学习者如何高效选择环境,以在实际约束下最大化关于真实奖励函数的信息增益?
- RQ4与非自适应基线相比,主动贪婪算法在奖励估计的收敛速度和最终误差方面表现如何?
- RQ5所提出方法对超参数(如奖励估计步骤中的正则化参数)的敏感性如何?
主要发现
- 在不受限的环境选择理想设定下,所提算法仅需 O(log(d/ϵ)) 个环境即可实现对真实奖励函数的 ϵ-识别,其中 d 为状态数。
- 在环境选择受限的设定下,贪婪算法在减少一致奖励函数集合体积方面,其解与最优解相差一个对数因子。
- 贪婪算法收敛速度显著快于非自适应方法:25轮后,其误差为 0.2687(±0.0302),而最优非自适应方法的误差为 0.9691(±0.24310)。
- 随着轮次增加,贪婪算法持续改进,而非自适应方法则趋于停滞,表明主动选择可使学习者访问到固定采样分布之外的新信息环境。
- 该方法对正则化参数 λ 的选择具有鲁棒性;在 λ 的广泛取值范围内,性能保持稳定且定性相似,仅当 λ ≥ 1 时出现病态行为。
- 在迷宫环境中的实证结果表明,主动多环境 IRL 显著优于单环境和非自适应多环境基线方法,在奖励恢复精度方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。