[论文解读] Learning Behaviors with Uncertain Human Feedback
该论文提出了一种新颖的基于概率的人类反馈模型,能够处理强化学习过程中人类训练者响应的不确定性,尤其是在最优动作不明确或奖励具有随机性时。该方法引入了一种近似EM算法,结合梯度下降来估计反馈模型参数,在不确定环境中显著提升了策略学习效果,即使人类反馈偏离了假设模型,也优于基线方法。
Human feedback is widely used to train agents in many domains. However, previous works rarely consider the uncertainty when humans provide feedback, especially in cases that the optimal actions are not obvious to the trainers. For example, the reward of a sub-optimal action can be stochastic and sometimes exceeds that of the optimal action, which is common in games or real-world. Trainers are likely to provide positive feedback to sub-optimal actions, negative feedback to the optimal actions and even do not provide feedback in some confusing situations. Existing works, which utilize the Expectation Maximization (EM) algorithm and treat the feedback model as hidden parameters, do not consider uncertainties in the learning environment and human feedback. To address this challenge, we introduce a novel feedback model that considers the uncertainty of human feedback. However, this incurs intractable calculus in the EM algorithm. To this end, we propose a novel approximate EM algorithm, in which we approximate the expectation step with the Gradient Descent method. Experimental results in both synthetic scenarios and two real-world scenarios with human participants demonstrate the superior performance of our proposed approach.
研究动机与目标
- 解决现有强化学习方法假设人类反馈为确定性的问题,即使训练者对最优动作存在不确定性。
- 将人类反馈建模为依赖于动作最优性的概率函数,反映现实世界中反馈的模糊性。
- 开发一种计算上可行的学习算法,联合优化智能体策略与人类反馈模型参数。
- 评估当人类反馈不严格遵循假设的概率模型时,方法的鲁棒性。
提出的方法
- 提出一种反馈模型,其中正向/负向反馈的概率根据动作与最优动作的距离而增减,采用高斯分布进行建模。
- 引入一种近似EM算法,通过解耦参数估计:首先固定部分参数(如标准差),然后使用梯度下降优化其余参数。
- 在E步近似中使用梯度下降,以处理由概率反馈模型引发的不可计算积分。
- 采用两阶段学习流程:首先通过EM估计策略参数,然后通过梯度下降优化反馈模型参数。
- 将人类反馈模型视为具有可学习参数的隐变量,从而实现策略与反馈模型的联合优化。
- 在合成环境及两个真实世界的人机协同任务(老鼠觅食与虚拟狗训练)中验证该方法。
实验结果
研究问题
- RQ1在最优动作模糊且具有随机性的环境中,建模人类反馈不确定性在多大程度上能提升策略学习效果?
- RQ2当精确推断不可行时,结合梯度下降的近似EM算法能否有效学习智能体策略与人类反馈模型参数?
- RQ3当人类训练者不遵循假设的反馈模型时,所提方法的鲁棒性如何?
- RQ4状态数与动作数的变化对反馈模型参数估计精度与学习性能有何影响?
- RQ5在不同反馈条件下,该方法是否在收敛速度与最终策略质量方面均优于现有基线方法?
主要发现
- 所提出的ABLUF方法在合成环境与真实世界环境中,均在多个指标(如每步捕获的老鼠数、与最优策略的累积距离)上优于BLUF与ISABL基线方法。
- 在老鼠觅食任务中,ABLUF在动作数增加时性能显著优于基线,表明其在复杂动作空间中具有更强的处理能力。
- 在虚拟狗训练任务中,ABLUF显著降低了与最优策略的累积距离,证明其具备更快且更精确的策略学习能力。
- 鲁棒性分析表明,即使训练者提供的反馈不遵循假设模型,ABLUF仍能保持优异性能,证明其对现实世界反馈多样性的适应能力。
- 该方法在大多数设置下能以低方差学习反馈模型参数σ,但在极短episode中因未收敛而性能受限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。