[论文解读] FCSS: Fully Convolutional Self-Similarity for Dense Semantic Correspondence
FCSS 是一种全卷积自相似性描述符,能够在深层网络中端到端地学习局部结构采样模式与自相似性度量,从而在保持精确定位的同时,对类内外观变化具有鲁棒性。通过利用对象提议先验和对应一致性进行弱监督学习,FCSS 在语义对应基准上实现了最先进性能。
We present a descriptor, called fully convolutional self-similarity (FCSS), for dense semantic correspondence. To robustly match points among different instances within the same object class, we formulate FCSS using local self-similarity (LSS) within a fully convolutional network. In contrast to existing CNN-based descriptors, FCSS is inherently insensitive to intra-class appearance variations because of its LSS-based structure, while maintaining the precise localization ability of deep neural networks. The sampling patterns of local structure and the self-similarity measure are jointly learned within the proposed network in an end-to-end and multi-scale manner. As training data for semantic correspondence is rather limited, we propose to leverage object candidate priors provided in existing image datasets and also correspondence consistency between object pairs to enable weakly-supervised learning. Experiments demonstrate that FCSS outperforms conventional handcrafted descriptors and CNN-based descriptors on various benchmarks.
研究动机与目标
- 为解决在显著类内外观变化(如颜色、光照和纹理差异)下的密集语义对应问题。
- 开发一种基于 CNN 的描述符,即使在大范围外观变化下仍能保持高定位精度,克服现有深度学习和手工描述符的局限性。
- 在缺乏丰富密集真实对应标注的情况下,通过弱监督学习实现描述符的有效训练。
- 以端到端、多尺度的方式联合学习最优局部块采样模式与可微分自相似性度量。
提出的方法
- 引入一种可微分的卷积自相似性(CSS)层,将学习到的局部自相似性(LSS)结构编码进全卷积网络中。
- 利用跳跃连接以端到端、多尺度的方式联合学习块采样模式与自相似性度量,同时保留空间细节。
- 采用弱监督训练方案,利用图像数据集中对象对之间的对象提议先验和对应一致性,以减少对密集标注的依赖。
- 利用跳跃连接聚合多尺度特征,提升定位精度并增强对形变的鲁棒性。
- 在流估计框架中应用 FCSS 描述符,结合稀疏流(SF)或提议流(PF)优化以实现密集对应。
实验结果
研究问题
- RQ1能否使基于深度学习的描述符在保持精确定位的同时,对类内外观变化具有内在鲁棒性,以实现密集语义对应?
- RQ2如何有效学习局部自相似性,并将其可微分地集成到全卷积网络中,以支持端到端训练?
- RQ3利用对象提议和对应一致性进行弱监督学习,在有限密集监督下,能在多大程度上提升描述符性能?
- RQ4所提出的 FCSS 描述符是否在标准语义对应基准上优于现有的基于 CNN 和手工设计的描述符?
主要发现
- 在 Caltech-101 数据集上,FCSS 达到了 0.52 的最高 IoU 分数,优于先前方法如 VGG with SF(IoU: 0.51)和 FCSS w/SF(IoU: 0.50)。
- 在 PASCAL-VOC part 数据集上,FCSS w/PF 实现了 0.83 的标签迁移准确率(LT-ACC),超过次优方法(0.80),展现出更优的部件匹配性能。
- 在 Proposal Flow 基准上,FCSS w/PF 的 PCK@0.1 达到 0.46,优于 UCN(0.44)和 FCSS w/SF(0.47),表明关键点对齐精度优异。
- 在 PASCAL-VOC 和 Caltech-101 上的可视化结果表明,FCSS 生成了最准确且一致的密集光流场,误匹配和噪声最少。
- 该方法在所有评估基准(包括 Taniai et al.、Proposal Flow、PASCAL-VOC 和 Caltech-101)上均取得了最先进结果,证实了其鲁棒性和泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。