[论文解读] Interpretable Preference-based Reinforcement Learning with Tree-Structured Reward Functions
本文提出了一种在线、主动的基于偏好的强化学习算法,能够从人类反馈中构建内在可解释的树状结构奖励函数。通过将状态-动作空间分层分解为互不重叠的组件,并利用置信上界(UCB)逐步优化,该方法实现了样本高效的训练,并增强了对对齐调试的支持,已在四个环境中通过合成反馈和人类反馈得到验证。
The potential of reinforcement learning (RL) to deliver aligned and performant agents is partially bottlenecked by the reward engineering problem. One alternative to heuristic trial-and-error is preference-based RL (PbRL), where a reward function is inferred from sparse human feedback. However, prior PbRL methods lack interpretability of the learned reward structure, which hampers the ability to assess robustness and alignment. We propose an online, active preference learning algorithm that constructs reward functions with the intrinsically interpretable, compositional structure of a tree. Using both synthetic and human-provided feedback, we demonstrate sample-efficient learning of tree-structured reward functions in several environments, then harness the enhanced interpretability to explore and debug for alignment.
研究动机与目标
- 为解决基于偏好的强化学习中先前方法使用不透明神经网络所导致的可解释性差距。
- 实现稳健、人类可读的奖励函数结构,以支持对齐评估与调试。
- 开发一种主动学习算法,通过人类偏好反馈逐步构建并优化树状结构奖励函数。
- 在多个环境中,于离线与在线设置下均实现样本高效且对齐的训练。
- 通过组件级可视化与特征重要性分析,提供诊断工具以识别对齐偏差与故障模式。
提出的方法
- 该方法构建一个二叉树状结构的奖励函数,其中每个叶节点代表状态-动作空间的一个互不重叠子集,内部节点则表示奖励的分层组合。
- 每个奖励组件建模为具有均值与方差的高斯分布,基于带偏好评价的轨迹进行估计,从而支持不确定性感知的主动学习。
- 算法使用置信上界(UCB)选择最具信息量的偏好查询,优先对不确定性较高的组件进行优化。
- 通过基于偏好反馈的增量增长与剪枝,动态更新树结构,以保持可解释性与组合结构。
- 该方法支持多种可视化:组件级学习曲线、轨迹级适应度估计,以及以析取范式(DNF)描述的文本报告卡,用于说明轨迹行为。
- 通过树结构高效计算特征重要性,从而分析哪些组件主导了策略行为。
实验结果
研究问题
- RQ1能否在稀疏人类偏好下高效学习树状结构奖励函数,同时保持可解释性?
- RQ2树状结构奖励的可解释性在对齐调试与故障分析中如何提升?
- RQ3基于不确定性的查询选择在偏好型强化学习中在多大程度上提升了样本效率?
- RQ4组件级动态与奖励结构如何影响复杂环境中策略行为与收敛性?
- RQ5该方法能否检测并诊断对齐偏差问题,如因果混淆或过早奖励固定?
主要发现
- 该算法在四个基准环境中,使用合成反馈与人类提供反馈,均实现了树状结构奖励函数的样本高效学习。
- 在 FoodLava 环境中,智能体在第 250 集时已学会优先关注目标区域(组件 9),大部分时间停留于此,并实现快速导航成功。
- 对应于目标的组件 1 的平均奖励随时间逐渐上升,方差减小,表明最优行为学习过程稳定。
- 该方法成功识别出对齐偏差:一个高性能的轨迹(第 975 集)被发现存在偏差,尽管表现优异,智能体仍停留在非目标组件(6)。
- 系统生成的诊断报告卡以自然语言描述轨迹行为,可区分对齐(如:抵达目标)与非对齐(如:笔直前行)的轨迹。
- 在离线设置中,该方法揭示了故障模式,如因果混淆:由于探索受限,智能体学习利用虚假相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。