[论文解读] Learning Correspondence from the Cycle-Consistency of Time
本文提出一种自监督方法,通过时间上的循环一致性作为免费的监督信号,从原始视频中学习视觉对应关系。通过训练深度特征网络在时间循环中实现循环一致的跟踪,模型学习到一种通用的表示能力,可实现零样本迁移至下游任务(如光流估计、关键点跟踪和实例分割),性能与监督方法相当。
We introduce a self-supervised method for learning visual correspondence from unlabeled video. The main idea is to use cycle-consistency in time as free supervisory signal for learning visual representations from scratch. At training time, our model learns a feature map representation to be useful for performing cycle-consistent tracking. At test time, we use the acquired representation to find nearest neighbors across space and time. We demonstrate the generalizability of the representation -- without finetuning -- across a range of visual correspondence tasks, including video object segmentation, keypoint tracking, and optical flow. Our approach outperforms previous self-supervised methods and performs competitively with strongly supervised methods.
研究动机与目标
- 从无标注视频中学习视觉对应关系表示,无需人工标注或合成数据。
- 解决动态场景中由于运动和环境因素导致外观变化带来的对应关系学习挑战。
- 利用视频中的时间连续性作为自监督信号进行表示学习。
- 实现所学特征在无需微调的情况下,零样本迁移到多种对应关系任务中。
- 开发一种可扩展的端到端框架,能够跨不同抽象层次(从像素级到物体级)实现泛化。
提出的方法
- 该方法使用时间上的循环一致跟踪作为自监督目标:将一个图像块在视频序列中正向跟踪后,再反向跟踪,损失函数为原始位置与最终位置之间的距离。
- 可微分跟踪器在深度特征空间中执行模板匹配以估计对应关系,网络训练目标是最小化循环不一致性。
- 模型学习到的特征表示能够在局部时间变换(如光照变化、运动和遮挡)下保持鲁棒性。
- 同时优化多种循环长度,包括跳帧循环(skip-cycles),以应对遮挡和姿态突变。
- 训练过程隐式学习到一种对短期外观变化不敏感的视觉相似性度量。
- 在测试时,最终表示作为独立的距离度量,用于跨时空的最近邻搜索。
实验结果
研究问题
- RQ1时间上的循环一致性能否作为强大且可扩展的监督信号,用于在无人工标注的情况下学习视觉对应关系?
- RQ2在原始视频上预训练的自监督表示能否泛化到多种对应关系任务(如光流、关键点跟踪和实例分割)?
- RQ3与监督方法及先前的自监督方法相比,该方法在性能和泛化能力方面表现如何?
- RQ4模型能否在遮挡和快速外观变化等挑战性条件下学习到鲁棒的对应关系?
- RQ5使用多种循环长度和跳帧循环是否能提升训练稳定性和性能?
主要发现
- 在 DAVIS-2017 数据集上的长程光流任务中,该方法在自监督方法中达到最先进性能,FlowNet2 基准下 mIoU 达到 15.6%。
- 在 VIP 数据集上的人体部位标注传播任务中,该方法在 0.5 IoU 阈值下达到 23.0% $AP^{r}_{ ext{vol}}$,优于 ImageNet 预训练的 ResNet-50(24.2%)。
- 在纹理传播任务中,模型成功保持了 6 种颜色条纹在帧间的结构一致性,展示了精确的对应关系学习能力。
- 在视频帧重建任务中,尽管未进行像素级训练,该方法的 L1 重建误差仍低于 FlowNet2 和 ImageNet 预训练模型(5 帧间隔为 60.4,10 帧间隔为 76.4)。
- 该模型在无需微调的情况下,成功实现跨任务的零样本迁移,涵盖视频对象分割、关键点跟踪和光流估计。
- 该方法在性能上与完全监督模型相当,在 VIP 数据集上达到 37.9% mIoU,接近完全监督的 SOTA 水平(37.9%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。