[论文解读] MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features
MC-JEPA 提出了一种多任务自监督学习框架,通过共享编码器联合学习运动(光流)和内容特征,结合基于 PWC-Net 的光流估计与 VICReg 的对比自监督学习方法。该方法在光流基准测试中达到最先进性能,并在图像与视频分割任务中展现出强大的迁移性能,证明了运动与内容表征学习之间的相互促进作用。
Self-supervised learning of visual representations has been focusing on learning content features, which do not capture object motion or location, and focus on identifying and differentiating objects in images and videos. On the other hand, optical flow estimation is a task that does not involve understanding the content of the images on which it is estimated. We unify the two approaches and introduce MC-JEPA, a joint-embedding predictive architecture and self-supervised learning approach to jointly learn optical flow and content features within a shared encoder, demonstrating that the two associated objectives; the optical flow estimation objective and the self-supervised learning objective; benefit from each other and thus learn content features that incorporate motion information. The proposed approach achieves performance on-par with existing unsupervised optical flow benchmarks, as well as with common self-supervised learning approaches on downstream tasks such as semantic segmentation of images and videos.
研究动机与目标
- 解决现有自监督方法仅关注内容特征而未捕捉运动或像素级动态的局限性。
- 将光流估计与自监督内容表征学习统一到单一联合嵌入架构中,以提升特征泛化能力。
- 通过学习运动感知的内容特征,实现对下游任务(如语义分割)的迁移学习。
- 证明在多任务设置下,共享表征学习使运动与内容学习目标能够相互受益。
- 探究训练调度、损失加权及网络组件对性能与特征质量的影响。
提出的方法
- 提出 M-JEPA,一种基于 PWC-Net 的自监督光流估计器,改进包括反向一致性损失和协方差-方差正则化。
- 将 M-JEPA 与 VICReg(一种在 ImageNet 上预训练的对比自监督学习方法)结合,在多任务设置下联合优化光流与内容特征。
- 使用共享编码器生成同时编码运动(光流)与语义内容的联合嵌入,支持在视频与图像数据上端到端训练。
- 应用多任务损失,结合光流估计损失(含循环一致性)与 VICReg 对比损失,通过可学习系数进行平衡。
- 采用数据采样策略(如训练周期交替与批量交替),在统一训练调度下同时训练 ImageNet 与视频数据集。
- 在光流估计头中使用层归一化与 L2 归一化等架构组件,以稳定训练并提升性能。
实验结果
研究问题
- RQ1在多任务设置下联合学习光流与内容特征,是否能同时提升运动估计与语义理解任务的性能?
- RQ2在预训练过程中,光流学习的引入顺序与时机如何影响最终表征的质量?
- RQ3在多种下游任务中实现最优性能时,光流估计与自监督内容学习目标之间的最优平衡是什么?
- RQ4在自监督设置下,引入循环一致性与协方差-方差正则化是否能显著提升光流估计性能?
- RQ5在混合图像与视频数据上训练的单一共享编码器,能否生成可泛化且适用于分割等密集预测任务的特征?
主要发现
- MC-JEPA 在 KITTI 2015 光流数据集上达到 2.67 的误差,与最先进无监督方法持平,同时实现内容特征的联合学习。
- 在 Cityscapes 数据集上,MC-JEPA 在图像分割任务中达到 67.1% 的平均 IoU,在视频分割任务中达到 70.5%,展现出强大的迁移性能。
- 消融实验表明,先进行 10 个周期的 ImageNet 预训练再启动光流训练可获得最优结果,且计算量更低,表明早期联合训练并非必需。
- 循环一致性损失显著提升光流估计性能,当系数为 0.01 时性能达到峰值,凸显其在稳定嵌入空间中的作用。
- 多任务平衡系数具有关键影响:当系数超过 0.1 时性能下降,表明运动与内容学习之间存在权衡。
- 使用 ConvNeXt-T 作为主干网络时性能最佳(图像分割 67.1%,视频分割 70.5%),优于 ResNet-50 与 PWC-Net,表明网络架构选择对特征质量至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。