[论文解读] MoreFusion: Multi-object Reasoning for 6D Pose Estimation from Volumetric Fusion
MoreFusion 提出了一种实时、多目标 6D 姿态估计系统,通过 RGB-D 数据的体素融合,联合优化物体姿态,并利用可微分碰撞检测强制执行非相交约束。通过整合周围占据网格和 CAD 模型拟合,其在 YCB-Video 和杂乱 YCB-Video 数据集上实现了最先进性能,实现了在杂乱场景中稳健的机器人操作。
Robots and other smart devices need efficient object-based scene representations from their on-board vision systems to reason about contact, physics and occlusion. Recognized precise object models will play an important role alongside non-parametric reconstructions of unrecognized structures. We present a system which can estimate the accurate poses of multiple known objects in contact and occlusion from real-time, embodied multi-view vision. Our approach makes 3D object pose proposals from single RGB-D views, accumulates pose estimates and non-parametric occupancy information from multiple views as the camera moves, and performs joint optimization to estimate consistent, non-intersecting poses for multiple objects in contact. We verify the accuracy and robustness of our approach experimentally on 2 object datasets: YCB-Video, and our own challenging Cluttered YCB-Video. We demonstrate a real-time robotics application where a robot arm precisely and orderly disassembles complicated piles of objects, using only on-board RGB-D vision.
研究动机与目标
- 通过车载 RGB-D 传感器,在杂乱、遮挡和接触配置的场景中,实现对多个已知物体的精确、实时 6D 姿态估计。
- 通过利用从学习得到的体素占据图获得的空间感知能力,解决物体之间相互遮挡和接触的挑战。
- 通过使用碰撞约束联合优化多个物体姿态,将姿态精度提升至超越单物体、基于深度的方法。
- 将持久的 3D 场景表示与 CAD 模型对齐相结合,实现鲁棒、增量式的场景重建和机器人规划。
- 展示一种基于车载视觉的实时增量系统,能够实现对杂乱物体堆的智能拆解。
提出的方法
- 系统将 2D 实例分割掩码和 RGB-D 数据融合为一个 32×32×32 的体素化体积分占据网格,表示自由空间、占据空间和未知空间。
- 基于 3D-CNN 的姿态预测网络利用目标物体的 RGB-D 图像裁剪和周围占据网格,生成初始 6D 姿态假设。
- 迭代碰撞检测(ICC)通过在体素空间中惩罚相交,实现可微分的、联合的多个物体姿态优化。
- 姿态精炼结合 ICC 与 ICP,在碰撞解决后提升表面级对齐精度。
- 当在无相交情况下实现高置信度对齐时,系统会逐步用高保真 CAD 模型替换体素化物体表示。
- 整个流程端到端可微分,运行实时,支持增量式场景重建和机器人任务执行。
实验结果
研究问题
- RQ1如何仅使用 RGB-D 输入,在存在相互遮挡和接触的场景中提升多目标 6D 姿态估计性能?
- RQ2与单物体方法相比,通过体素占据图引入周围空间感知,能在多大程度上提升姿态预测精度?
- RQ3可微分碰撞检测是否能够通过联合优化多个物体姿态来解决相交问题并提升一致性?
- RQ4CAD 模型拟合的集成如何提升在杂乱环境中的姿态精度和场景表示?
- RQ5基于体素融合的实时、增量系统是否能够实现如拆解杂乱物体堆等复杂机器人操作任务?
主要发现
- MoreFusion 在杂乱 YCB-Video 数据集上实现了 83.4% 的 ADD(-S) 和 92.3% 的 ADD-S,分别优于 DenseFusion* 1.7% 和 0.6%。
- 引入周围占据信息可提升性能:即使不使用占据信息(-occ),MoreFusion 仍因采用 3D-CNN 架构而优于 DenseFusion*。
- ICC 与 ICP 精炼的结合效果最佳,尤其在低可见度(如 <40%)条件下,ICC 可解决 ICP 单独无法处理的碰撞问题。
- 在可见度受限子集(可见度 < 0.3)上,MoreFusion 实现了 63.5% 的 ADD(-S) 和 85.1% 的 ADD-S,优于 DenseFusion*(59.7% 和 83.8%)。
- 该系统实现了在杂乱场景中的实时机器人抓取与放置,成功移除遮挡物并精确放置目标物体,仅依赖车载 RGB-D 视觉。
- 完整系统演示展示了增量式场景重建与精确 CAD 对齐,其中被遮挡物体的姿态通过邻近物体的空间约束进行推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。