[论文解读] Semi-supervised reward learning for offline reinforcement learning
本文提出了一种用于离线强化学习的半监督奖励学习方法,利用有限的人工标注——无论是任务级别的示范还是稀疏的时间步级别奖励——以及未标注数据来训练高效策略。通过结合自监督、迭代精炼和多实例学习,该方法即使在监督信息极少的情况下,也能实现接近真实奖励的性能,并表明离线强化学习对不完善的奖励模型具有鲁棒性。
In offline reinforcement learning (RL) agents are trained using a logged dataset. It appears to be the most natural route to attack real-life applications because in domains such as healthcare and robotics interactions with the environment are either expensive or unethical. Training agents usually requires reward functions, but unfortunately, rewards are seldom available in practice and their engineering is challenging and laborious. To overcome this, we investigate reward learning under the constraint of minimizing human reward annotations. We consider two types of supervision: timestep annotations and demonstrations. We propose semi-supervised learning algorithms that learn from limited annotations and incorporate unlabelled data. In our experiments with a simulated robotic arm, we greatly improve upon behavioural cloning and closely approach the performance achieved with ground truth rewards. We further investigate the relationship between the quality of the reward model and the final policies. We notice, for example, that the reward models do not need to be perfect to result in useful policies.
研究动机与目标
- 解决现实世界中离线强化学习应用中奖励信号稀疏或不可用的挑战。
- 通过结合大规模未标注数据集和有限的人工标注,提升奖励学习的样本效率。
- 探究奖励模型质量与离线强化学习下游策略性能之间的关系。
- 开发有效的半监督算法,以结合任务级别和时间步级别监督。
- 证明离线强化学习对不完善的奖励模型具有鲁棒性,从而减少对高质量奖励标注的依赖。
提出的方法
- 提出一种半监督学习框架,利用有限的人工标注数据(时间步或任务级别)和未标注轨迹联合训练奖励模型。
- 通过时间结构化模型(TGR-i)实现迭代精炼,利用奖励模型的预测结果在多轮迭代中改进自身的标签估计。
- 采用多实例学习原则,通过成功示范的时间结构,从粗粒度的任务级别标注中推断出时间步级别的奖励。
- 使用自训练和协同训练启发式策略,将模型的预测结果作为伪标签,用于精炼同一模型或相关模型。
- 引入多头分类头进行奖励预测,损失函数针对类别不平衡问题,使用精确率、F-score和AUC-PR指标进行优化。
- 基于多个指标的验证分数选择奖励模型,利用这些模型指导离线强化学习中的策略训练。
实验结果
研究问题
- RQ1仅使用任务级别示范而无任何时间步级别奖励标注,能否有效训练离线强化学习策略?
- RQ2半监督奖励模型的质量与离线强化学习中所得策略性能之间的相关性如何?
- RQ3当使用不完美或噪声奖励模型时,离线强化学习算法的泛化能力在多大程度上得以保持?
- RQ4即使初始监督信息稀疏,奖励预测的迭代精炼是否仍能提升策略性能?
- RQ5哪些奖励模型评估指标(如精确率、F-score、AUC-PR)最能预测下游策略性能?
主要发现
- 所提出的半监督奖励学习方法即使在极少人工监督下,也能实现接近真实奖励训练的策略性能。
- 仅基于任务级别示范训练的奖励模型所得到的策略,可超越行为克隆,且性能接近真实奖励基线。
- 高精确率、高F-score或高AUC-PR的奖励模型始终与更好的策略回报相关,但无单一指标能完美预测策略性能。
- 即使分类得分较低的奖励模型也能为策略训练提供有效信号,表明离线强化学习对噪声或不完善的奖励函数具有鲁棒性。
- 对奖励模型的迭代精炼降低了策略回报的方差,提升了训练稳定性,并有助于模型选择。
- 该方法表明,结合未标注数据与稀疏标注——尤其是利用时间结构——可显著减少对昂贵时间步级别标注的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。