[论文解读] SAFARI: Safe and Active Robot Imitation Learning with Imagination
SAFARI 提出了一种安全且主动的模仿学习框架,通过结合行为克隆、基于模型的规划以及不确定性估计,最小化分布偏移并预测失败。通过主动查询分布外状态下的示范,并利用未来状态预测检测异常,SAFARI 提升了机器人操作任务中的泛化能力和安全性。
One of the main issues in Imitation Learning is the erroneous behavior of an agent when facing out-of-distribution situations, not covered by the set of demonstrations given by the expert. In this work, we tackle this problem by introducing a novel active learning and control algorithm, SAFARI. During training, it allows an agent to request further human demonstrations when these out-of-distribution situations are met. At deployment, it combines model-free acting using behavioural cloning with model-based planning to reduce state-distribution shift, using future state reconstruction as a test for state familiarity. We empirically demonstrate how this method increases the performance on a set of manipulation tasks with respect to passive Imitation Learning, by gathering more informative demonstrations and by minimizing state-distribution shift at test time. We also show how this method enables the agent to autonomously predict failure rapidly and safely.
研究动机与目标
- 解决代理在遇到专家示范中未涵盖的分布外(OOD)状态时,模仿学习中出现错误行为的问题。
- 通过结合无模型策略执行与在线规划,最小化与示范状态的偏离,减少部署过程中的状态分布偏移。
- 在测试时实现自主、安全的故障预测,无需人工监督,从而提升机器人安全性。
- 通过主动选择最不确定、因而最具信息量的状态进行专家示范,提升训练过程中的数据效率。
提出的方法
- 通过行为克隆在专家示范上训练策略网络,以模仿专家行为。
- 学习一个动力学模型(世界模型),用于从当前状态和动作预测未来状态,从而支持在线规划。
- 采用认知不确定性网络估计预测中的不确定性,通过未来状态重建识别分布外状态。
- 利用不确定性估计在训练期间触发主动学习,向专家查询高不确定性状态下的示范。
- 在测试时,将策略动作与最小化不确定性的规划动作结合,将状态拉回训练分布。
- 使用卷积自编码器将RGB观测压缩为16维潜在向量,并与机器人状态特征拼接作为输入。
实验结果
研究问题
- RQ1基于不确定性估计的主动学习是否能减少所需专家示范的数量,同时提升策略泛化能力?
- RQ2基于模型的规划在模仿学习中部署时,能在多大程度上减少状态分布偏移?
- RQ3通过学习的动力学模型进行未来状态预测,是否能比反应式方法实现更快、更可靠的故障检测?
- RQ4将无模型策略执行与不确定性感知规划相结合,如何提升真实世界操作任务中的性能与安全性?
主要发现
- 采用 γ = 0.8 的主动学习方法在性能上优于被动模仿学习,表明主动选择的示范更具信息量。
- 在1个方块抓取与放置任务中,SAFARI 在50次测试中实现了 8.8 ± 2.35 次成功,显著优于行为克隆方法(7.6 ± 2.35)。
- 在2个方块堆叠任务中,SAFARI 实现了 5.9 ± 4.0 次成功,而行为克隆仅为 3.4 ± 2.6,表明在复杂任务中具有更强的鲁棒性。
- 结合无模型策略执行与在线规划的混合策略显著减少了分布偏移,并在所有评估任务中提升了测试性能。
- 通过未来状态想象实现的故障预测在F1分数上表现优异(从0到10步未来预测均稳定),同时减少了故障检测所需步数,增强了安全性。
- 该方法在测试时能自主检测危险状态,实现无需人工干预的安全执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。