[论文解读] RoboAssembly: Learning Generalizable Furniture Assembly Policy in a Novel Multi-robot Contact-rich Simulation Environment
本文提出 RoboAssembly,一个用于通过深度强化学习学习可泛化的家具装配策略的多机器人、高接触力的仿真环境。通过结合结构化表示与无模型强化学习及模仿学习,该方法在对象中心设置下对未见过的椅子实现了 74.5% 的成功率,显著优于 RRT-Connect 基线(18.8%),且规划速度更快,泛化能力更强。
Part assembly is a typical but challenging task in robotics, where robots assemble a set of individual parts into a complete shape. In this paper, we develop a robotic assembly simulation environment for furniture assembly. We formulate the part assembly task as a concrete reinforcement learning problem and propose a pipeline for robots to learn to assemble a diverse set of chairs. Experiments show that when testing with unseen chairs, our approach achieves a success rate of 74.5% under the object-centric setting and 50.0% under the full setting. We adopt an RRT-Connect algorithm as the baseline, which only achieves a success rate of 18.8% after a significantly longer computation time. Supplemental materials and videos are available on our project webpage.
研究动机与目标
- 开发一个逼真的、高接触力的多机器人仿真环境,用于复杂家具装配任务。
- 将机器人家具装配问题形式化为具有结构化状态表示的强化学习问题。
- 学习一种可泛化的策略,能够通过多机器人协作装配多样且未见过的椅子设计。
- 在成功率和计算效率方面,优于传统运动规划方法(如 RRT-Connect)。
- 展示策略在零样本设置下对训练期间未见过的新椅子配置的泛化能力。
提出的方法
- 设计一种新型多机器人仿真环境,包含安装在移动平台上的两台 Franka 机械臂,支持复杂的高接触力操作。
- 集成运动规划模块,实现在装配过程中多个机器人之间的无碰撞、协调运动。
- 构建来自 PartNet 的 220 种椅子数据集,标注可抓取区域与连接点,以实现逼真的装配任务。
- 使用以对象为中心和完整观测状态表示,将装配任务形式化为分层强化学习问题。
- 通过模仿学习与无模型强化学习联合训练统一策略网络,利用 640 个单任务策略的数据增强。
- 采用多任务训练流程,学习一种可泛化的策略,能够在零样本设置下推广至未见过的椅子设计。
实验结果
研究问题
- RQ1在多机器人、高接触力的装配环境中,深度强化学习策略是否能泛化到未见过的家具设计?
- RQ2与传统运动规划方法(如 RRT-Connect)相比,所提出的基于强化学习的策略在成功率和规划效率方面表现如何?
- RQ3与完整观测设置相比,以对象为中心的状态表示在多大程度上提升了策略的泛化能力?
- RQ4结合模仿学习与无模型强化学习,能否有效实现从单任务到多任务家具装配技能的迁移?
- RQ5将运动规划模块集成到强化学习流程中,是否能实现比独立规划器更快、更可靠的路径规划?
主要发现
- 在对象中心设置下,所提方法在未见过的椅子上实现了 74.5% 的成功率,显著优于 RRT-Connect 基线(18.8%)。
- 在完整观测设置下,该方法在未见过的椅子上实现了 50.0% 的成功率,证明了其强大的零样本泛化能力。
- 所训练策略平均每个椅子规划 37.8k 步,而 RRT-Connect 需要 91.7k 步,表明计算效率更高。
- 在 640 个增强的单任务策略上进行多任务训练的策略,能有效泛化至 192 种未见过的椅子,证实了其鲁棒性与可扩展性。
- 该方法将平均规划时间减少至每次成功装配不到两分钟,而 RRT-Connect 需要显著更长的计算时间。
- 在困难训练集上,对象中心设置下的成功率为 79.4%,表明其在复杂、具有挑战性的椅子构型下仍具有强大性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。