[论文解读] Learning Object-Centric Video Models by Contrasting Sets
本文提出 SetCon,一种基于全局集合的对比损失方法,通过对比聚合的槽位集合而非单个槽位,改进了以对象为中心的视频表征学习,解决了先前基于槽位的对比方法在无法强制实现多样化对象表征方面的根本缺陷。该方法采用基于注意力的槽位注意力机制并结合可学习的槽位初始化,实现在合成视频数据集上重建、未来预测和对象分离任务的最先进性能。
Contrastive, self-supervised learning of object representations recently emerged as an attractive alternative to reconstruction-based training. Prior approaches focus on contrasting individual object representations (slots) against one another. However, a fundamental problem with this approach is that the overall contrastive loss is the same for (i) representing a different object in each slot, as it is for (ii) (re-)representing the same object in all slots. Thus, this objective does not inherently push towards the emergence of object-centric representations in the slots. We address this problem by introducing a global, set-based contrastive loss: instead of contrasting individual slot representations against one another, we aggregate the representations and contrast the joined sets against one another. Additionally, we introduce attention-based encoders to this contrastive setup which simplifies training and provides interpretable object masks. Our results on two synthetic video datasets suggest that this approach compares favorably against previous contrastive methods in terms of reconstruction, future prediction and object separation performance.
研究动机与目标
- 解决基于槽位的对比学习的根本局限性,即当槽位表示不同对象或相同对象时,损失值相同。
- 通过引入一种全局的、基于集合的对比损失,促进协同且多样化的槽位表征,从而改进以对象为中心的表征学习。
- 通过基于注意力的槽位编码器简化训练过程,并实现可解释的对象掩码。
- 在合成视频数据集上评估该方法在重建、未来预测和对象分离方面的性能。
提出的方法
- 提出一种全局集合对比损失(SetCon),该损失对比所有槽位的聚合表示(全局场景表征)而非单个槽位对。
- 使用基于 DeepSets 的集合编码器,将槽位表征聚合为当前帧和预测帧的全局场景向量 $\bm{z}_{\bm{s}_t}$ 和 $\bm{z}_{\bm{p}_t}$。
- 采用单次迭代的槽位注意力机制并结合可学习的槽位初始化,生成 $K$ 个以对象为中心的槽位表征 $\bm{s}_t \in \mathbb{R}^{K \times D}$。
- 应用一个转换模型,基于当前和历史表征预测未来帧的槽位表征 $\bm{p}_{t+1}^k$。
- 在全局场景表征上应用对比的 InfoNCE 损失:$\mathcal{L}^{i} = -\mathbb{E}_{\bm{X}}\left[\log \frac{g(\bm{z}_{\bm{p}_t}^i, \bm{z}_{\bm{s}_t}^i)}{\sum_{\bm{z}_{\bm{s}_t}'^j \in \mathcal{B}} g(\bm{z}_{\bm{p}_t}^i, \bm{z}_{\bm{s}_t}'^j) + \sum_{\bm{z}_{\bm{p}_t}'^j \in \mathcal{B}} g(\bm{z}_{\bm{p}_t}^i, \bm{z}_{\bm{p}_t}'^j)} \right]$,其中 $g$ 为点积函数。
- 通过重建和未来预测任务的独立解码器,端到端训练模型。
实验结果
研究问题
- RQ1全局的、基于集合的对比损失是否能在学习多样化、以对象为中心的视频表征方面优于传统的基于槽位的对比损失?
- RQ2所提出的 SetCon 损失是否能有效防止模型在所有槽位中坍缩为单一对象表征?
- RQ3基于注意力的槽位编码器结合可学习初始化,对训练稳定性及对象掩码的可解释性有何影响?
- RQ4当依赖颜色进行对象分离时,该模型在存在多个外观相同对象的场景中泛化能力如何?
- RQ5仅使用时间对比信号,模型是否能在无监督条件下实现强大的未来预测与重建性能?
主要发现
- SetCon 方法在 Bouncing Balls 和 GridWorld 视频数据集上均实现了优于先前对比方法的重建性能。
- 该模型展现出强大的未来预测性能,在长达 5 个时间步的预测中均保持一致的优异表现,优于基于槽位的对比基线方法。
- 通过 ARI 评分衡量的对象分离性能显著提升,表明个体对象的解缠程度更高。
- 该方法在 Bouncing Balls 数据集上实现 0.0026 的重建均方误差,在 GridWorld 数据集上实现 0.0041,优于先前方法。
- 当在 GridWorld 数据集中引入更多颜色时,性能下降,表明模型在对象分离上依赖颜色线索。
- 随机初始化的槽位导致性能显著下降(未来预测的 MSE 达 6.016),表明可学习初始化对复杂场景的泛化至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。