[论文解读] Learning Vision-based Reactive Policies for Obstacle Avoidance
本文提出了一种统一的深度强化学习框架,通过将学习到的视觉潜在模型与黎曼运动策略(RMPs)相结合,为机器人机械臂学习基于视觉的反应式避障策略。该方法实现了高样本效率——在不到一小时的真实世界交互中即学习到稳定且成功的单障碍物和多障碍物避障策略——同时保持闭环响应能力,并可泛化至未见过的障碍物配置。
In this paper, we address the problem of vision-based obstacle avoidance for robotic manipulators. This topic poses challenges for both perception and motion generation. While most work in the field aims at improving one of those aspects, we provide a unified framework for approaching this problem. The main goal of this framework is to connect perception and motion by identifying the relationship between the visual input and the corresponding motion representation. To this end, we propose a method for learning reactive obstacle avoidance policies. We evaluate our method on goal-reaching tasks for single and multiple obstacles scenarios. We show the ability of the proposed method to efficiently learn stable obstacle avoidance strategies at a high success rate, while maintaining closed-loop responsiveness required for critical applications like human-robot interaction.
研究动机与目标
- 为解决在感知与运动规划紧密耦合的非结构化环境中基于视觉的避障挑战。
- 通过将无模型深度强化学习与手工设计的基于RMP的基线策略相结合,降低样本复杂度并提高真实世界机器人学习的安全性。
- 通过学习可解释的视觉表征,实现在不重新训练的情况下泛化至不同障碍物数量(1、2或3个)。
- 将感知与运动生成统一为单一端到端学习框架,同时保持关节限制并避免不稳定性。
提出的方法
- 该方法使用视觉潜在模型将原始RGB图像压缩为低维、可解释的表征,降低策略复杂度并提升泛化能力。
- 采用黎曼运动策略(RMPs)定义基线、可解释且安全的运动策略,尊重关节限制与运动学约束。
- 训练残差深度强化学习策略以增强基线RMP策略,仅学习用于避障的反应式部分。
- 奖励函数结合目标到达项与避障项,对碰撞施加负奖励,对靠近目标施加正奖励。
- 该框架在黎曼流形上使用端到端深度强化学习,以确保运动生成的几何一致性和稳定性。
- 探索由基线策略引导,该策略通过在训练早期即引导智能体朝向目标,显著提升样本效率,即使在遇到障碍物时亦然。
实验结果
研究问题
- RQ1统一框架能否有效学习直接将视觉输入映射到反应式运动的基于视觉的避障策略,而无需依赖显式的感知流水线?
- RQ2将学习到的残差策略与手工设计的RMP基线策略结合,如何提升真实世界机器人学习中的样本效率与成功率?
- RQ3在固定障碍物数量(如3个)上训练的策略,能在多大程度上泛化至障碍物更少(1个或2个)的环境中?
- RQ4深度强化学习能否在保持实时响应能力和安全性的前提下,有效应用于机械臂的基于视觉的避障?
主要发现
- 在不到一小时的真实世界交互后,该方法在单障碍物场景中实现了84±6%的成功率,优于基线DRL方法超过两倍的成功率。
- 与基线DRL相比,该方法达到收敛所需的episode数不足其一半,证明了更高的样本效率。
- 在包含三个障碍物的多障碍物场景中,策略在约10,000个episode(约3小时真实世界数据采集)后收敛,成功率达到72%。
- 策略对障碍物更少的环境具有有效泛化能力:1个障碍物时成功率为66%,2个障碍物时为54%,3个障碍物时为72%,表明其在训练配置之外也具备稳健泛化能力。
- 基线策略显著改善了探索效果,表现为更高的平均episode奖励和更快的收敛速度,相较于无基线策略训练。
- 视觉潜在模型有助于提升泛化能力并降低策略复杂度,从而实现稳定且可解释的反应式行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。