[论文解读] AutoLink: Self-supervised Learning of Human Skeletons and Object Outlines by Linking Keypoints
AutoLink 提出一种自监督方法,通过共享图结构联合预测2D关键点位置及其成对连接,以学习可解释的人体骨骼和物体轮廓。通过使用基于图的边图对掩码图像进行重建的自编码器,该方法将结构与外观解耦,在基准测试中实现了关键点定位的最先进性能,并在包括动物、手部和肖像在内的多种物体类别上实现良好泛化。
Structured representations such as keypoints are widely used in pose transfer, conditional image generation, animation, and 3D reconstruction. However, their supervised learning requires expensive annotation for each target domain. We propose a self-supervised method that learns to disentangle object structure from the appearance with a graph of 2D keypoints linked by straight edges. Both the keypoint location and their pairwise edge weights are learned, given only a collection of images depicting the same object class. The resulting graph is interpretable, for example, AutoLink recovers the human skeleton topology when applied to images showing people. Our key ingredients are i) an encoder that predicts keypoint locations in an input image, ii) a shared graph as a latent variable that links the same pairs of keypoints in every image, iii) an intermediate edge map that combines the latent graph edge weights and keypoint locations in a soft, differentiable manner, and iv) an inpainting objective on randomly masked images. Although simpler, AutoLink outperforms existing self-supervised methods on the established keypoint and pose estimation benchmarks and paves the way for structure-conditioned generative models on more diverse datasets. Project website: https://xingzhehe.github.io/autolink/.
研究动机与目标
- 解决缺乏可泛化的自监督方法来学习如骨骼和轮廓等结构化物体表征的问题。
- 克服监督关键点学习的局限性,后者需要昂贵的领域特定标注。
- 通过共享图作为潜在变量,实现结构拓扑与外观的解耦。
- 开发一种可在包括复杂纹理和非受控背景在内的多样化图像领域中泛化的模型。
- 实现在不依赖标注关键点数据的前提下,基于结构条件的图像生成。
提出的方法
- 该方法使用卷积编码器从输入图像中预测关键点位置。
- 一个具有可学习边权重的共享图作为潜在变量,对同一类别所有图像中一致的拓扑结构进行建模。
- 中间可微边图将关键点位置与边权重结合,生成一种软且具有空间感知能力的边表示。
- 模型通过在随机掩码像素图像上的自编码器重建目标进行训练,迫使解码器依赖结构线索。
- 图瓶颈确保仅保留结构信息,实现与外观的解耦。
- 训练目标鼓励模型生成准确、拓扑感知的关键点图,以支持高保真图像重建与生成。
实验结果
研究问题
- RQ1自监督方法是否能在无需任何标注关键点数据的情况下,学习到一致且可解释的物体结构(如人体骨骼和物体轮廓)?
- RQ2共享的关键点连接图在多样化图像领域中,对强制结构一致性有多有效?
- RQ3是否可通过基于图的瓶颈与掩码图像重建实现结构与外观的解耦?
- RQ4与将关键点视为独立部件的方法相比,显式建模关键点之间的连接是否能提升关键点定位的准确性?
- RQ5所学习的结构在多大程度上能支持下游任务,如在多样化数据集上进行条件图像生成?
主要发现
- AutoLink 在 CUB、DeepFashion 和 Human3.6M 等成熟基准上实现了关键点定位的最先进准确率,优于现有自监督方法。
- 该方法成功在包括肖像、动物、手部和花卉在内的多样化数据集中恢复了人体骨骼拓扑结构和物体轮廓,即使在杂乱背景和复杂纹理下也表现良好。
- 模型在新领域(包括 11k Hands、Horses、Zebras 和 Taichi)中表现出良好泛化能力,证明其超越以人类为中心数据的鲁棒性。
- 使用基于图的边图与掩码图像重建,有效实现了结构信息与外观的解耦,从而实现准确的结构预测。
- 所学习的关键点图支持使用自编码器和 GAN 的高质量条件图像生成,结构驱动的生成在视觉保真度上表现更优。
- 可视化结果证实,该模型在多样化图像类别中学习到了有意义且拓扑一致的连接关系——例如肢体与身体部位被正确连接。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。