Skip to main content
QUICK REVIEW

[论文解读] PIZZA: A Powerful Image-only Zero-Shot Zero-CAD Approach to 6 DoF Tracking

Van Nguyen Nguyen, Yuming Du|arXiv (Cornell University)|Sep 15, 2022
Advanced Vision and Imaging被引用 9
一句话总结

PIZZA 提出了一种新颖的仅图像、零样本、零 CAD 的 6D 物体位姿追踪方法,仅使用 RGB 视频,无需任何 3D 模型、训练图像或深度数据。它利用双帧网络和多帧 Transformer 编码器,并结合领域随机化的合成数据,在未事先了解物体的情况下,于真实世界数据集上实现了最先进性能。

ABSTRACT

Estimating the relative pose of a new object without prior knowledge is a hard problem, while it is an ability very much needed in robotics and Augmented Reality. We present a method for tracking the 6D motion of objects in RGB video sequences when neither the training images nor the 3D geometry of the objects are available. In contrast to previous works, our method can therefore consider unknown objects in open world instantly, without requiring any prior information or a specific training phase. We consider two architectures, one based on two frames, and the other relying on a Transformer Encoder, which can exploit an arbitrary number of past frames. We train our architectures using only synthetic renderings with domain randomization. Our results on challenging datasets are on par with previous works that require much more information (training images of the target objects, 3D models, and/or depth data). Our source code is available at https://github.com/nv-nguyen/pizza

研究动机与目标

  • 解决在开放世界场景中缺乏物体先验信息时的 6D 物体位姿追踪挑战。
  • 仅使用 RGB 视频实现零样本、零 CAD 的 6D 跟踪,消除对 3D 模型、深度数据或特定物体训练的依赖。
  • 克服现有方法依赖 CAD 模型、多张参考图像或深度输入的局限性。
  • 通过多帧建模和实例分割提升对遮挡和背景杂乱的鲁棒性。
  • 在无需微调的情况下,证明从合成训练数据到真实世界测试序列的泛化能力。

提出的方法

  • 提出两种架构:双帧网络和基于 Transformer 的编码器,后者可处理任意数量的过去帧以提升运动估计性能。
  • 仅在带有领域随机化的合成 RGB 渲染数据上训练模型,以模拟多样的真实世界条件。
  • 集成预训练的实例分割模型(例如来自 [13])以从杂乱背景中分离物体,提升运动预测的鲁棒性。
  • 将 6D 运动表示为连续帧之间的相对变换,并在预测中施加尺度一致性。
  • 采用相对位姿表示,确保平移幅度在共同尺度因子下保持一致。
  • 应用迭代优化:从初始真值位姿累积预测的相对位姿,以估计完整轨迹。

实验结果

研究问题

  • RQ1能否仅通过 RGB 视频实现 6D 物体位姿追踪,而无需任何 3D 模型、深度数据或特定物体的训练?
  • RQ2与逐帧方法相比,使用 Transformer 编码器的多帧建模在多大程度上提升了追踪精度并减少了漂移?
  • RQ3实例分割在多大程度上有助于缓解在杂乱背景中未见物体时的性能下降?
  • RQ4该方法在无需领域自适应的情况下,如何从合成训练数据泛化到真实世界基准?
  • RQ5当没有 CAD 模型时,背景复杂度和遮挡对零样本 6D 跟踪性能有何影响?

主要发现

  • 多帧 Transformer 架构的 PIZZA 变体在 Moped 和 Laval 真实世界数据集上实现了最先进性能,优于使用 3D 模型或深度数据的方法。
  • 在 Laval 数据集上,PIZZA 的多帧模型实现了 AUC (ADD) 为 72.2 和 AUC (ADD-S) 为 72.2,优于 MoveIt(64.7 和 69.7),并匹配使用一张参考图像的 LatentFusion 性能。
  • PIZZA 在高遮挡条件下仍保持强劲性能,相比其他方法退化程度最小,展现出卓越的鲁棒性。
  • 当仅使用一张参考图像时,该方法性能与 LatentFusion 相当,即使在 LatentFusion 使用八张图像时,PIZZA 仍保持竞争力。
  • 双帧变体在无 CAD 模型或深度数据的情况下表现具有竞争力,在 Moped 数据集上实现了 AUC (ADD) 为 47.5 和 AUC (ADD-S) 为 47.9。
  • 尽管在估计 Z 轴平移方面存在挑战,该方法仍表现出强大的泛化能力,且分割模块在掩码噪声较大的情况下也表现出鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。