[论文解读] Object Finding in Cluttered Scenes Using Interactive Perception
该论文提出了一种基于强化学习(RL)的主动且交互式的感知系统,用于在杂乱场景中使用RGB-D传感的机械臂寻找物体。通过利用压缩的截断符号距离场(TSDF)表示和端到端的RL策略学习,该方法在仿真中实现了超过88%的成功率,在真实世界实验中实现了100%的成功率,无需微调即可有效泛化到未见过的物体形状和尺寸。
Object finding in clutter is a skill that requires perception of the environment and in many cases physical interaction. In robotics, interactive perception defines a set of algorithms that leverage actions to improve the perception of the environment, and vice versa use perception to guide the next action. Scene interactions are difficult to model, therefore, most of the current systems use predefined heuristics. This limits their ability to efficiently search for the target object in a complex environment. In order to remove heuristics and the need for explicit models of the interactions, in this work we propose a reinforcement learning based active and interactive perception system for scene exploration and object search. We evaluate our work both in simulated and in real-world experiments using a robotic manipulator equipped with an RGB and a depth camera, and compare our system to two baselines. The results indicate that our approach, trained in simulation only, transfers smoothly to reality and can solve the object finding task efficiently and with more than 88% success rate.
研究动机与目标
- 开发一种鲁棒的、端到端的基于强化学习的方法,用于在杂乱环境中寻找物体,结合主动与交互式感知。
- 消除机器人场景探索中对人工设计启发式规则和预定义交互策略的依赖。
- 实现在仿真到真实机器人系统之间的零样本迁移,无需真实数据微调。
- 在未见过的杂乱场景中,对各种物体形状和尺寸实现有效泛化。
- 利用压缩的体素场景表示,学习高效的探索与终止策略。
提出的方法
- 使用离散化的截断符号距离场(TSDF)对3D场景状态进行压缩且可学习的表示。
- 采用带有经验回放的深度Q网络(DQN)训练基于当前场景状态选择动作的RL策略。
- 集成一个学习到的颜色检测器,根据颜色识别目标物体,假设目标为颜色特定。
- 设计的动作空间包含相机运动(视角变化)和物理交互(推动物体),以揭示被遮挡的目标。
- 仅在仿真环境中训练智能体,使用基于目标检测和探索进度的稀疏密集奖励。
- 应用领域随机化和任务特定增强,以提升仿真到真实世界的迁移性能,无需真实世界微调。
实验结果
研究问题
- RQ1端到端的强化学习策略能否在无需预设启发式规则的情况下,高效探索并交互杂乱的3D场景以定位目标物体?
- RQ2在仿真中训练的策略在真实世界机器人系统中进行交互式物体查找时,泛化能力如何?
- RQ3该方法在未见物体形状和尺寸上的泛化能力有多强?
- RQ4与基于启发式的基线方法(如GES和GNBV)相比,所提出的基于强化学习的方法在效率和成功率方面表现如何?
- RQ5当目标物体不存在且局部场景信息有限时,系统能否正确学习到适时终止任务?
主要发现
- 所提出的A3DE和I3DE强化学习智能体在仿真杂乱场景中成功率超过88%,在效率和成功率上均优于GNBV和GES基线方法。
- I3DE智能体在真实世界机器人机械臂上的实验中实现了100%的成功率,证明了无需真实数据微调即可实现鲁棒的仿真到真实迁移。
- 该方法对新物体类型具有良好的泛化能力,包括不同尺寸的几何基元、随机形状和真实物体模型,性能下降极小。
- I3DE智能体在复杂场景中所需步数显著少于GES基线,表明探索效率更高。
- 当目标物体不存在时,智能体在96.1%的试验中能正确终止任务,表明其具备有效的探索完成检测能力。
- 尽管GES基线在训练域内表现极佳,但当物体尺度发生变化时无法泛化,凸显了基于启发式方法的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。