Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Landmark Learning from Unpaired Data

Yinghao Xu, Ceyuan Yang|arXiv (Cornell University)|Jun 29, 2020
Generative Adversarial Networks and Image Synthesis参考文献 38被引用 9
一句话总结

该论文提出了一种跨图像循环一致性框架(C³),用于从未配对、未对齐的图像集合中进行无监督关键点学习——这些图像在外观和姿态上均存在差异。通过采用双重交换-重建策略,并引入跨图像光流模块以强制实现关键点等变性,该方法在关键点检测和语义对齐任务上取得了最先进性能,在基准数据集上显著优于以往的无监督方法。

ABSTRACT

Recent attempts for unsupervised landmark learning leverage synthesized image pairs that are similar in appearance but different in poses. These methods learn landmarks by encouraging the consistency between the original images and the images reconstructed from swapped appearances and poses. While synthesized image pairs are created by applying pre-defined transformations, they can not fully reflect the real variances in both appearances and poses. In this paper, we aim to open the possibility of learning landmarks on unpaired data (i.e. unaligned image pairs) sampled from a natural image collection, so that they can be different in both appearances and poses. To this end, we propose a cross-image cycle consistency framework ($C^3$) which applies the swapping-reconstruction strategy twice to obtain the final supervision. Moreover, a cross-image flow module is further introduced to impose the equivariance between estimated landmarks across images. Through comprehensive experiments, our proposed framework is shown to outperform strong baselines by a large margin. Besides quantitative results, we also provide visualization and interpretation on our learned models, which not only verifies the effectiveness of the learned landmarks, but also leads to important insights that are beneficial for future research.

研究动机与目标

  • 为了实现从外观和姿态各异的未配对图像集合中进行无监督关键点学习,克服以往方法依赖于合成图像对的局限性。
  • 为了解决现有无监督方法中外观与姿态因子解耦效果差的问题,后者可能导致姿态特定表示中出现与外观相关的伪影。
  • 通过强制实施跨图像循环一致性与几何等变性,提升关键点的一致性与解耦性。
  • 证明所学习的关键点在多样化物体类别(包括汽车和卧室场景)上的泛化能力,而不仅限于人脸。

提出的方法

  • 提出一种跨图像循环一致性(C³)框架,通过两次应用交换-重建策略:利用另一张图像的外观和自身姿态来重建每张图像,从而形成一个循环。
  • 引入一种跨图像光流模块,用于估计未配对图像之间的密集对应图,从而在检测到的关键点之间实现几何一致性。
  • 施加等变性约束:在一张图像中检测到的关键点,应在预测的跨图像光流作用下保持一致变换,以防止出现平凡解。
  • 采用两阶段训练流程:首先,通过条件自编码器分离外观与姿态特征;其次,通过对抗损失和重建损失强制实现循环一致性和关键点等变性。
  • 利用自然图像集合中的未配对数据,避免了对具有相同外观但不同姿态的图像对的需求。
  • 将跨图像光流模块适配用于语义对齐任务,展示了其在相关任务中的可迁移性。

实验结果

研究问题

  • RQ1是否可以在外观和姿态各异的未配对图像数据上有效实现无监督关键点学习,而非依赖于具有固定变换的合成图像对?
  • RQ2如何利用循环一致性来改善关键点表征学习中外观与姿态因子的解耦性?
  • RQ3通过光流模块实现的跨图像几何对应关系在提升关键点一致性与跨多样化图像分布的泛化能力方面起到何种作用?
  • RQ4该框架在人脸以外的物体类别(如汽车和室内场景)上具有多大程度的泛化能力?
  • RQ5所学习的关键点表征在提升相关任务(如语义对齐)上的性能方面表现如何?与最先进方法相比,在效率和准确性方面有何差异?

主要发现

  • 所提出的C³框架在PF-PASCAL数据集上的语义对齐任务中达到80.1%的PCK分数,优于之前最先进方法NC-Net的1.2%,且仅使用其17%的FLOPs(81 GFLOPs vs. 471 GFLOPs)。
  • 在关键点检测任务中,该方法显著优于强基线模型,展现出对姿态特定关键点与外观特定因素的优越解耦能力。
  • 可视化结果表明,即使在卧室和汽车等复杂场景中,所学习的关键点在几何和语义上也保持高度一致性。
  • 跨图像光流模块增强了关键点的一致性,并有效支持了语义对齐任务的迁移,验证了其在建模跨图像几何关系方面的作用。
  • 该框架成功从未配对数据中学习到解耦的、姿态特定的关键点,避免了引入参考图像外观的伪影,如定性对比所示。
  • 该方法在多样化物体类别上泛化良好,汽车和卧室场景中均出现了稳定的关犍点模式,表明其具备稳健的结构理解能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。