[论文解读] Non-Markovian Reward Modelling from Trajectory Labels via Interpretable Multiple Instance Learning
该论文提出了一种新颖的非马尔可夫奖励建模方法,采用可解释的多实例学习(MIL),将轨迹视为包(bags),状态-动作对视为实例,以建模人类反馈中的时序依赖性。该方法使用基于LSTM的MIL模型,从带有回报标签的轨迹中重建隐藏状态动态和奖励函数,实现了高精度,并使强化学习(RL)智能体能够在不访问真实奖励的情况下解决非马尔可夫任务,性能达到或超过访问真实奖励时的表现。
We generalise the problem of reward modelling (RM) for reinforcement learning (RL) to handle non-Markovian rewards. Existing work assumes that human evaluators observe each step in a trajectory independently when providing feedback on agent behaviour. In this work, we remove this assumption, extending RM to capture temporal dependencies in human assessment of trajectories. We show how RM can be approached as a multiple instance learning (MIL) problem, where trajectories are treated as bags with return labels, and steps within the trajectories are instances with unseen reward labels. We go on to develop new MIL models that are able to capture the time dependencies in labelled trajectories. We demonstrate on a range of RL tasks that our novel MIL models can reconstruct reward functions to a high level of accuracy, and can be used to train high-performing agent policies.
研究动机与目标
- 通过考虑人类轨迹评估中的时序依赖性,将奖励建模从马尔可夫假设中推广出来。
- 解决人类反馈中独立、瞬时奖励评估在心理和实际应用上的局限性。
- 开发一种方法,从轨迹回报标签中重建隐藏状态动态和奖励函数。
- 使强化学习智能体仅通过回报标签轨迹即可学习高性能策略,而无需访问真实奖励或隐藏状态。
- 提供可解释性工具,用于验证和理解学习到的奖励函数与隐藏状态动态。
提出的方法
- 将非马尔可夫奖励建模形式化为多实例学习(MIL)问题,其中轨迹作为包,状态-动作对作为实例。
- 使用长短期记忆(LSTM)网络对跨轨迹的隐藏状态动态进行建模,并推断实例级别的奖励预测。
- 设计新颖的MIL模型架构,从包级别的回报标签中联合学习奖励函数与隐藏状态表征。
- 应用可解释性技术分析和验证所学习模型的内部表征与决策过程。
- 在轨迹回报标签上端到端训练模型,实现在无实例级别标签监督的情况下推断奖励与隐藏状态轨迹。
- 将学习到的奖励模型集成到强化学习训练流程中,以评估在非马尔可夫任务上的策略性能。
实验结果
研究问题
- RQ1多实例学习能否有效建模依赖于可见状态无法捕捉的隐藏状态动态的非马尔可夫奖励函数?
- RQ2基于MIL的模型在从回报标签轨迹中重建真实隐藏状态与奖励函数方面表现如何?
- RQ3使用预测奖励训练的强化学习智能体能否实现与访问真实奖励和隐藏状态的智能体相当或更优的性能?
- RQ4所提出的MIL模型在轨迹数据存在标签噪声和分布偏移时的鲁棒性如何?
- RQ5可解释性分析能为所学习奖励模型的内部表征与决策过程提供哪些洞见?
主要发现
- 所提出的基于MIL的奖励模型在合成非马尔可夫环境中准确重建了真实奖励函数与隐藏状态轨迹。
- 模型在回报预测方面表现出高精度,性能与访问真实隐藏状态的模型相当或更优。
- 使用MIL模型预测奖励训练的强化学习智能体在非马尔可夫任务中实现了与访问真实奖励的智能体相当或更优的性能。
- 可解释性分析表明,模型学习到了有意义的隐藏状态动态,如关键物品收集与宝藏区域进入,与人类推断的轨迹语义一致。
- 模型对标签噪声表现出鲁棒性,在回报标签被污染或不一致时仍保持强劲性能。
- 在Lunar Lander任务中,模型学习到了优于真实奖励函数的实用改进,例如奖励远离边缘的安全悬停位置,从而提升了悬停任务的实际表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。