Skip to main content
QUICK REVIEW

[论文解读] Virtual View Networks for Object Reconstruction

João Carreira, Abhishek Kar|arXiv (Cornell University)|Nov 22, 2014
Advanced Vision and Imaging被引用 5
一句话总结

本文提出虚拟视图网络(VVN),通过将一组相似物体的视图对齐,合成虚拟视图,从而从单张图像重建3D物体形状。通过利用学习到的物体视角网络上的测地线路径,并增强基于因子分解的SfM的鲁棒性,该方法在具有挑战性的PASCAL VOC类别上实现了高精度的3D重建,即使输入视图有限亦可。

ABSTRACT

All that structure from motion algorithms "see" are sets of 2D points. We show that these impoverished views of the world can be faked for the purpose of reconstructing objects in challenging settings, such as from a single image, or from a few ones far apart, by recognizing the object and getting help from a collection of images of other objects from the same class. We synthesize virtual views by computing geodesics on novel networks connecting objects with similar viewpoints, and introduce techniques to increase the specificity and robustness of factorization-based object reconstruction in this setting. We report accurate object shape reconstruction from a single image on challenging PASCAL VOC data, which suggests that the current domain of applications of rigid structure-from-motion techniques may be significantly extended.

研究动机与目标

  • 将刚性结构从运动(SfM)技术扩展至仅有一张输入图像或视角相距甚远的情况。
  • 克服标准SfM在处理物体类别间视角变化大和形状差异时的局限性。
  • 在应用于噪声大、合成的虚拟视图时,提升基于因子分解的SfM的鲁棒性和特异性。
  • 仅通过识别和可重用的训练图像集合,实现对通用物体类别的高精度3D重建。
  • 开发一种新颖的对齐框架,利用类别级知识和姿态预测,以应对大视角差异。

提出的方法

  • 通过基于视角相似性的方法,将同一类物体的图像连接起来,构建虚拟视图网络(VVN),实现在视角之间的平滑插值。
  • 利用姿态预测和描述符空间(基于二阶池化AlexNet fc5特征)中的最近邻搜索,识别与目标物体视角相似的候选图像。
  • 通过VVN上的测地线路径,将对应关系从目标物体传播到集合中的其他图像,实现在大视角变化下的鲁棒2D对齐。
  • 应用缩放正交因子分解,从虚拟视图中重建3D形状,采用正则化优化以减少对噪声的过拟合。
  • 引入基于领域知识(如双边对称性)的内点外推,以提升重建精度,尤其适用于凹形或模糊形状。
  • 在因子分解过程中强调高置信度对应关系,以提高特异性并减少最终3D点云中的伪影。

实验结果

研究问题

  • RQ1能否通过结构从运动技术,从单张图像实现3D物体重建?
  • RQ2当将目标物体与一组相似物体对齐时,如何在大视角变化下稳健地合成虚拟视图?
  • RQ3在存在显著视角和形状变化的情况下,学习到的虚拟视图网络上的测地线路径能否提升对齐的鲁棒性?
  • RQ4在应用于多样化物体集合中生成的合成、噪声虚拟视图时,基于因子分解的SfM能在多大程度上实现鲁棒性和特异性?
  • RQ5在数据量有限的情况下,结合类别级知识和对称性约束在多大程度上能提升重建质量?

主要发现

  • 该方法在使用VVN框架生成的虚拟视图下,能够从单张图像实现对PASCAL VOC物体的高精度3D重建,即使对于飞机和鸟类等复杂形状亦可。
  • 内点外推显著提升了重建质量,尤其对电视/显示器类别,否则会生成类似达利钟表的弯曲、不真实形状。
  • 该方法成功重建了大多数动物类别,但马和船类因类内差异大和姿态困难而出现明显退化。
  • 双边对称性被有效利用以改善3D结构,尤其对汽车和飞机等对称物体,但对人类因姿态和形态的非对称性而效果较弱。
  • 该方法优于仅依赖轮廓的视觉外壳方法,后者忽略纹理和对应信息,无法捕捉凹陷结构。
  • 重建结果已公开在线,视频演示可通过 http://youtu.be/JfDJji5sYXE 查看,为该新颖任务的未来评估提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。