Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Viewpoint Estimation

Hung-Yu Tseng, Shalini De Mello|arXiv (Cornell University)|May 13, 2019
Advanced Image Processing Techniques参考文献 42被引用 7
一句话总结

本文提出 MetaView,一种少样本视角估计框架,通过元学习和一种新型元孪生网络,仅需每种新类别1–10张标注图像,即可估计3D标准关键点、其2D投影及深度值。该方法在 ObjectNet3D 和 Pascal3D+ 上显著优于微调当前最先进模型,以极少的标注工作量实现了最先进性能。

ABSTRACT

Viewpoint estimation for known categories of objects has been improved significantly thanks to deep networks and large datasets, but generalization to unknown categories is still very challenging. With an aim towards improving performance on unknown categories, we introduce the problem of category-level few-shot viewpoint estimation. We design a novel framework to successfully train viewpoint networks for new categories with few examples (10 or less). We formulate the problem as one of learning to estimate category-specific 3D canonical shapes, their associated depth estimates, and semantic 2D keypoints. We apply meta-learning to learn weights for our network that are amenable to category-specific few-shot fine-tuning. Furthermore, we design a flexible meta-Siamese network that maximizes information sharing during meta-learning. Through extensive experimentation on the ObjectNet3D and Pascal3D+ benchmark datasets, we demonstrate that our framework, which we call MetaView, significantly outperforms fine-tuning the state-of-the-art models with few examples, and that the specific architectural innovations of our method are crucial to achieving good performance.

研究动机与目标

  • 解决未知物体类别视角估计的挑战,传统深度学习方法因缺乏足够训练数据而失效。
  • 通过仅使用每类别10个或更少的标注样本,实现对新类别的有效少样本适应,提升泛化能力。
  • 设计一种元学习框架,学习在新类别上实现快速微调的最优初始化权重。
  • 开发一种灵活的信息共享架构,支持任意数量的关键点,并提升少样本泛化能力。

提出的方法

  • 将视角估计建模为从少量图像中学习类别特定的3D标准形状、2D关键点投影及深度值。
  • 采用元学习训练网络,使其初始化权重在新类别上进行少样本微调时具备良好泛化能力。
  • 提出一种元孪生架构,在元训练过程中最大化支持图像之间的特征共享。
  • 引入集中度损失项 $ L_{con} $,以在微调后促使关键点热力图更加清晰、局部化。
  • 将多峰值关键点图作为输入,以提升在多样化物体类别上的鲁棒性与泛化能力。
  • 动态调整网络架构,以支持每种类别不同数量的关键点,实现灵活的少样本适应。

实验结果

研究问题

  • RQ1元学习能否有效应用于未知类别物体的少样本视角估计?
  • RQ2元孪生网络设计在少样本关键点检测中如何提升信息共享与性能?
  • RQ3集中度损失项在少样本微调过程中在多大程度上提升了关键点定位精度?
  • RQ4处理可变数量关键点的能力是否提升了在少样本设置下对多样化物体类别的泛化能力?

主要发现

  • MetaView 在 ObjectNet3D 和 Pascal3D+ 上均显著优于微调当前最先进模型(如 StarMap),且每类别仅需1–10张样本。
  • 在同数据集实验中,MetaView 在10张样本下实现平均误差 31.5° ± 0.72,显著优于基线模型及 StarMap* + MAML。
  • 消融实验表明,元孪生设计与集中度损失对性能贡献最大,其中仅元孪生结构相比非孪生基线即可将误差降低10°以上。
  • 即使使用更小的主干网络,MetaView 仍超越先前最先进性能,证明其高效性与有效性。
  • 定性结果表明,经过少样本微调后,关键点热力图在相关物体部位上变得清晰局部化,表明成功适应。
  • 性能随样本数量单调提升:平均误差从1张样本时的55.2°降至10张样本时的31.5°,证实更多样本具有可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。