[论文解读] Coarse-to-Fine Q-attention with Learned Path Ranking
本文提出了一种名为学习路径排序(LPR)的方法,通过学习对多种路径(由规划、Bézier曲线或行为克隆策略生成)进行排序,以增强C2F-ARM,从而实现复杂操作任务中样本高效、基于视觉的强化学习,这些任务需要精确运动控制。关键贡献是C2F-ARM+LPR,该方法在16项RLBench任务中实现了100%的成功率,并仅通过3次示范便在10–15分钟内学会了打开马桶座圈或文件柜等真实世界任务。
We propose Learned Path Ranking (LPR), a method that accepts an end-effector goal pose, and learns to rank a set of goal-reaching paths generated from an array of path generating methods, including: path planning, Bezier curve sampling, and a learned policy. The core idea being that each of the path generation modules will be useful in different tasks, or at different stages in a task. When LPR is added as an extension to C2F-ARM, our new system, C2F-ARM+LPR, retains the sample efficiency of its predecessor, while also being able to accomplish a larger set of tasks; in particular, tasks that require very specific motions (e.g. opening toilet seat) that need to be inferred from both demonstrations and exploration data. In addition to benchmarking our approach across 16 RLBench tasks, we also learn real-world tasks, tabula rasa, in 10-15 minutes, with only 3 demonstrations.
研究动机与目标
- 为解决C2F-ARM在学习需要高度特定运动的任务(如打开马桶座圈)时的局限性,这些任务无法仅通过通用路径规划解决。
- 使单一智能体能够在不事先了解物体运动学知识的情况下,学习多样化、任务特定的运动模式。
- 通过结合多种路径生成方法与学习到的排序函数,提高真实世界训练中的样本效率。
- 使系统能够在稀疏奖励和视觉输入条件下泛化,包括需要精细运动控制的任务。
- 通过从示范和探索数据中学习路径偏好,减少对人工编码运动基元的依赖。
提出的方法
- LPR学习一个Q函数,用于对来自三种来源生成的多样化无碰撞路径进行排序:基于采样的路径规划、Bézier曲线采样以及行为克隆策略。
- 路径策略通过行为克隆在成功完成任务的路径上进行训练,使其能够在不直接进行奖励塑形的情况下学习运动偏好。
- 推理时,从LPR Q函数中选择排名最高的路径并执行,使系统能够动态选择不同路径生成策略。
- 该方法通过将下一最佳姿态输出作为路径排序模块的输入,与C2F-ARM集成,从而保持原始系统的样本效率。
- 系统采用混合路径生成流程,随着训练进展,从基于采样的方法逐步过渡到基于策略的路径。
- 路径策略在训练过程中不使用视觉输入,从而在最小化计算开销的同时仍能实现有效的路径选择。
实验结果
研究问题
- RQ1在缺乏对象特定知识的前提下,学习路径排序机制是否能提升基于视觉、稀疏奖励强化学习的任务覆盖范围?
- RQ2结合规划、曲线采样和学习策略的混合路径生成方法在解决复杂操作任务方面的有效性如何?
- RQ3LPR是否能够使C2F-ARM在极少数示范下学习真实世界任务中需要精确运动控制的任务?
- RQ4集成行为克隆的路径策略是否能提升在高运动特异性任务上的泛化能力和成功率?
- RQ5随着训练进展,系统在多大程度上能够减少对基于采样路径规划的依赖?
主要发现
- C2F-ARM+LPR在16项RLBench任务中均实现了100%的成功率,包括需要高度特定运动的任务,如打开马桶座圈或抽屉。
- 系统仅通过3次遥操作示范,便在约10–15分钟内学会了真实世界任务,如打开文件柜和玩具洗碗机。
- 在需要滑动或直线运动的任务中(如open_drawer),路径策略排名最高;而在需要旋转关节的任务中(如lift_toilet_seat_up),曲线路径更受青睐。
- 该方法在保持C2F-ARM样本效率的同时扩展了其任务范围,且在先前已解决的任务上未出现性能下降。
- 随着训练进展,学习到的路径策略变得越来越有效,对基于采样路径生成的依赖逐渐减少。
- 定性结果表明,LPR能够根据任务动力学正确选择合适的路径类型,可视化结果证实了跨多个训练周期的一致路径选择模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。