[论文解读] Learning Object-conditioned Exploration using Distributed Soft Actor Critic
本文提出了一种可扩展的、分布式的软 actor-critic(SAC)强化学习框架,用于在模拟机器人导航中实现端到端的物体引导探索与底层控制。在 24 小时内使用 8 张 GPU 训练了 9800 万次经验步数后,该方法在未见过的、视觉复杂的家庭环境中实现了 68% 的成功率和 0.58 的 SPL,无需显式监督即可学习自然的探索行为与连续控制。
Object navigation is defined as navigating to an object of a given label in a complex, unexplored environment. In its general form, this problem poses several challenges for Robotics: semantic exploration of unknown environments in search of an object and low-level control. In this work we study object-guided exploration and low-level control, and present an end-to-end trained navigation policy achieving a success rate of 0.68 and SPL of 0.58 on unseen, visually complex scans of real homes. We propose a highly scalable implementation of an off-policy Reinforcement Learning algorithm, distributed Soft Actor Critic, which allows the system to utilize 98M experience steps in 24 hours on 8 GPUs. Our system learns to control a differential drive mobile base in simulation from a stack of high dimensional observations commonly used on robotic platforms. The learned policy is capable of object-guided exploratory behaviors and low-level control learned from pure experiences in realistic environments.
研究动机与目标
- 开发一种可扩展的、端到端的强化学习策略,用于在无布局或物体位置先验知识的视觉复杂、非结构化环境中实现物体导航。
- 解决在真实模拟环境中同时面临的语义探索(通过上下文线索寻找物体)与底层连续控制(操作差速驱动机器人)的双重挑战。
- 证明在纯经验学习中,涌现的探索行为(如探视房间、回溯、直接奔向可见目标)可自然产生,无需显式监督。
- 评估传感器模态(如 RGBD、LiDAR)对导航性能和鲁棒性的影响,特别是在狭窄通道和远距离导航场景中。
提出的方法
- 该方法采用软 actor-critic(SAC)算法的分布式实现,支持在多个 GPU 上并行收集经验并优化模型。
- 使用 ResNet50 + LSTM 架构处理高维观测(如 RGB、深度图、LiDAR),输出用于差速驱动机器人的连续控制指令。
- 系统在基于真实家庭扫描构建的仿真环境中进行端到端训练,包含物理建模以实现逼真的底层控制。
- 从视觉丰富、复杂的环境中收集交互经验,且不提供任何先验地图或定位信息。
- 使用离策略数据进行策略训练,以最大化样本效率,降低数据收集成本。
- 传感器包括 RGB、深度图和 LiDAR,并对目标检测(Det)对性能的影响进行了消融研究。
实验结果
研究问题
- RQ1单一端到端策略是否能在无显式监督的情况下,学习在视觉复杂、类真实世界模拟环境中实现物体引导的探索与底层控制?
- RQ2LiDAR 或目标检测(Det)的引入如何影响导航性能,特别是在远距离或狭窄路径场景中?
- RQ3在该设置下,通过纯强化学习训练自然涌现出哪些探索行为(如探视、绕圈、回溯)?
- RQ4记忆限制(如 LSTM)在多大程度上影响长期导航?由此产生的故障模式是什么?
- RQ5在经验收集和训练效率方面,该分布式 SAC 框架的可扩展性如何?
主要发现
- 该系统在未见过的、视觉复杂的实际家庭扫描环境中实现了 68% 的成功率和 0.58 的 SPL,表现出强大的泛化能力。
- 策略学习到了自然且上下文感知的探索行为,如探视房间、绕圈以获取 360° 视野,以及在未找到目标时回溯。
- 只有在目标被视觉检测到后,才会出现直接奔向目标的导航行为,表明感知与控制的有效整合。
- 使用 LiDAR 显著提升了远距离导航任务的性能,特别是在狭窄门框处,得益于更优的碰撞避免能力。
- 目标检测(Det)在所有目标类型上均提升了性能,尤其在目标较小或距离较远时效果显著,平均 SPL 从无 Det 时的 0.28 提升至有 Det 时的 0.52。
- 出现了次优行为,如重复访问已探索区域或在视野外的盲区卡住,表明长期记忆和视野外感知能力存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。