[论文解读] Active Learning for Risk-Sensitive Inverse Reinforcement Learning
本文提出了一种用于风险敏感逆强化学习(RS-IRL)的主动学习框架,通过自适应选择具有信息量的扰动,加速收敛并降低学习人类风险偏好的方差。通过在单纯形上计算未来的优化方向,该方法无需求解优化问题即可识别高影响力的示范,显著提升了单步与多步设置下的样本效率。
One typical assumption in inverse reinforcement learning (IRL) is that human experts act to optimize the expected utility of a stochastic cost with a fixed distribution. This assumption deviates from actual human behaviors under ambiguity. Risk-sensitive inverse reinforcement learning (RS-IRL) bridges such gap by assuming that humans act according to a random cost with respect to a set of subjectively distorted distributions instead of a fixed one. Such assumption provides the additional flexibility to model human's risk preferences, represented by a risk envelope, in safe-critical tasks. However, like other learning from demonstration techniques, RS-IRL could also suffer inefficient learning due to redundant demonstrations. Inspired by the concept of active learning, this research derives a probabilistic disturbance sampling scheme to enable an RS-IRL agent to query expert support that is likely to expose unrevealed boundaries of the expert's risk envelope. Experimental results confirm that our approach accelerates the convergence of RS-IRL algorithms with lower variance while still guaranteeing unbiased convergence.
研究动机与目标
- 解决由于冗余专家示范导致的 RS-IRL 收敛缓慢问题。
- 利用一致风险度量和风险包络,建模在模糊性下的个体风险偏好。
- 开发一种主动学习方案,选择最可能揭示专家风险包络未暴露边界的扰动。
- 实现在每一步均无需求解完整优化问题的前提下,高效且自适应地查询专家示范。
- 在模拟的跟车任务中,针对具有风险寻求与风险规避倾向的参与者验证该方法。
提出的方法
- 该方法推导出一种基于概率的扰动采样方案,通过在单纯形上估计未来优化方向,识别具有信息量的扰动。
- 采用二次特征函数建模代价函数,包括相对距离、速度以及控制努力惩罚项。
- 通过专家示范推断风险包络,利用半空间约束表示,主动学习优先选择最可能优化包络边界的扰动。
- 通过计算扰动实现生成新半空间约束的潜力来评估其有效性,避免求解完整优化问题。
- 通过分析连续阶段中各序列阶段的扰动,将该方法推广至多步设置。
- 采用 K-means 聚类将专家反应序列离散化为 15 种代表性行为,用于仿真与分析。
实验结果
研究问题
- RQ1主动学习能否通过选择具有信息量的示范,提升风险敏感逆强化学习的样本效率?
- RQ2RS-IRL 代理如何识别最可能优化专家风险包络边界的扰动?
- RQ3与随机或均匀示范采样相比,所提出的主动学习方案是否能降低方差并加速收敛?
- RQ4该方法能否推广至多步序列决策任务(如自动驾驶)?
- RQ5风险偏好(如风险寻求或风险规避行为)如何影响具有信息量扰动的选择?
主要发现
- 与基线方法相比,主动学习方案在重复实验中显著加速了 RS-IRL 的收敛,且方差更低。
- 该方法成功识别出能实现风险包络优化的扰动,模拟中第 25 阶段对风险寻求参与者产生了主导性约束。
- 在第 25 阶段,主动学习对加速度操作的采样概率为 0.4227,与专家的风险偏好一致。
- 在第 25 阶段,扰动采样概率分布 p = [0.3802, 0.4227, 0.1971] 偏向于最能暴露专家风险包络的操纵方式。
- 该方法无需在每一步求解完整优化问题,即可高效推断风险包络,仅依赖于优化方向的估计。
- 实验结果证实了无偏收敛,同时减少了冗余示范,验证了该方法在安全关键场景下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。