[论文解读] Model-Based Inverse Reinforcement Learning from Visual Demonstrations
该论文提出了一种基于梯度的逆强化学习框架,通过在关键点表示的潜在空间中使用预训练的视觉动力学模型,从视觉人类示范中学习代价函数。通过对内层策略优化过程进行反向传播,该方法实现了稳定且样本高效的逆强化学习,用于机器人操作任务,在真实硬件上实现了4.26 mm的平均平方误差(关键点追踪性能),优于基线方法。
Scaling model-based inverse reinforcement learning (IRL) to real robotic manipulation tasks with unknown dynamics remains an open problem. The key challenges lie in learning good dynamics models, developing algorithms that scale to high-dimensional state-spaces and being able to learn from both visual and proprioceptive demonstrations. In this work, we present a gradient-based inverse reinforcement learning framework that utilizes a pre-trained visual dynamics model to learn cost functions when given only visual human demonstrations. The learned cost functions are then used to reproduce the demonstrated behavior via visual model predictive control. We evaluate our framework on hardware on two basic object manipulation tasks.
研究动机与目标
- 在动力学未知的真实世界机器人操作任务中,实现基于模型的从视觉示范进行逆强化学习。
- 解决仅能获取视觉示范而缺乏本体感知状态测量时学习代价函数的挑战。
- 开发一种可微分的、基于梯度的逆强化学习算法,避免在外层优化步骤中因人工设计的距离度量而引起的不稳定性。
- 通过从示范中学习相对关键点轨迹,实现对不同起始配置的泛化能力。
- 在真实机器人硬件上验证该方法,采用Kuka iiwa机械臂完成物体放置任务。
提出的方法
- 一种自监督关键点检测器从人类示范和机器人观测中提取2D视觉特征,实现场景的低维潜在表征。
- 预训练视觉动力学模型以预测时间步之间关键点表征的变化,从而实现在潜在空间中对动作序列的前向仿真。
- 内层优化步骤使用视觉模型预测控制生成最小化代价函数的动作序列,同时通过动力学模型和策略优化过程反向传播梯度。
- 外层优化步骤采用基于梯度的双层优化方法,通过对内层策略优化过程求导来更新代价函数参数,从而实现稳定且高效的训练。
- 评估了三种代价函数架构:简单加权距离、时间相关权重和基于RBF的权重,所有代价函数均在潜在空间中的关键点位置上定义。
- 该框架将示范处理为相对轨迹,以提升对不同起始配置和视角的鲁棒性。
实验结果
研究问题
- RQ1基于梯度的逆强化学习框架能否仅从纯视觉人类示范中学习到有效的代价函数,而无需本体感知状态反馈?
- RQ2与特征匹配基线相比,通过对内层策略优化过程进行反向传播,如何提升稳定性与性能?
- RQ3在关键点表示的潜在空间中,学习到的视觉动力学模型在真实机器人操作任务中,对不同起始位置的泛化能力有多强?
- RQ4与简单加权代价函数相比,时间相关和基于RBF的代价函数在追踪精度和鲁棒性方面表现如何?
- RQ5该框架能否仅使用视觉示范和预训练的动力学模型,在真实硬件上复现人类行为?
主要发现
- 逆强化学习损失在约2,000个训练步内收敛,表明代价函数参数的优化是有效的。
- 时间相关和基于RBF的代价函数在Kuka iiwa上实现了4.26 mm(±1.20)的关键点追踪平均平方误差,显著优于基线的26.96 mm。
- 基于RBF的代价函数在起始配置1上达到最低误差4.26 mm,在起始配置2上为4.40 mm,表明其在不同初始位置间具有强大的泛化能力。
- 时间相关代价函数在起始配置1上误差为6.12 mm(±0.94),在起始配置2上为3.53 mm(±0.21),表明其性能优于简单加权代价函数。
- 简单加权代价函数在起始配置1上表现较差(误差40.99 mm),表明时间依赖性在复杂轨迹的泛化中至关重要。
- 该框架成功在真实硬件上复现了人类行为,仅依赖视觉示范和预训练的视觉动力学模型,验证了其在真实世界应用中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。