[论文解读] Object Permanence Emerges in a Random Walk along Memory
该论文提出了一种自监督对比随机游走目标,通过优化空间记忆表征的时间一致性,实现了视频模型中的物体恒常性,而无需对被遮挡物体进行显式标注。该方法通过使用遮挡前后的真实中心作为隐式监督,学习在完全遮挡期间维持和预测物体位置,仅需极少的监督信号,就在合成数据集和真实世界基准上实现了最先进性能。
This paper proposes a self-supervised objective for learning representations that localize objects under occlusion - a property known as object permanence. A central question is the choice of learning signal in cases of total occlusion. Rather than directly supervising the locations of invisible objects, we propose a self-supervised objective that requires neither human annotation, nor assumptions about object dynamics. We show that object permanence can emerge by optimizing for temporal coherence of memory: we fit a Markov walk along a space-time graph of memories, where the states in each time step are non-Markovian features from a sequence encoder. This leads to a memory representation that stores occluded objects and predicts their motion, to better localize them. The resulting model outperforms existing approaches on several datasets of increasing complexity and realism, despite requiring minimal supervision, and hence being broadly applicable.
研究动机与目标
- 解决在视频感知中对完全遮挡物体进行定位的挑战,因为直接监督在这些情况下不切实际或存在噪声。
- 消除对启发式动力学先验或密集人类标注的依赖,以确定不可见物体的位置。
- 通过自监督学习目标,使物体恒常性自然地从数据中涌现。
- 开发一种方法,即使在遮挡期间也能在记忆中保持空间对齐且以物体为中心的表征。
- 在极少监督下,证明方法在合成和真实世界视频数据集上的泛化能力。
提出的方法
- 该方法将时空对应关系建模为从序列编码器生成的记忆状态图上的马尔可夫游走。
- 图中的每个节点代表在特定时间步长的二维空间记忆特征图中的潜在物体位置。
- 仅在关键帧(遮挡前和遮挡后)对随机游走进行监督,使用真实物体中心作为监督信号。
- 对比损失鼓励游走者在穿越遮挡区域后返回正确位置,从而隐式监督记忆表征。
- 模型采用基于局部邻域的图连接结构,并使用带有 $3\times3$ 卷积核的池化头,以提升特征分辨率和定位精度。
- 应用标签平滑和中心重叠避免约束,以提升优化稳定性并减少误报。
实验结果
研究问题
- RQ1物体恒常性是否可以在无需对不可见物体位置进行显式标注的情况下,通过自监督方式自然涌现?
- RQ2在动态演变的空间记忆上进行对比随机游走,在遮挡期间维持以物体为中心表征的效率如何?
- RQ3该方法是否能在复杂度和真实感逐步提升的数据集上泛化,包括真实世界视频?
- RQ4模型是否能够学习维持关于被遮挡物体运动的多个假设,以反映非确定性行为中的不确定性?
- RQ5目标函数中的哪些组件对性能最为关键,它们如何影响定位精度?
主要发现
- 所提出的自监督方法在PD基准上达到72.0 mAP,优于未使用不可见物体真实标签的全监督基线(71.1 mAP)。
- 在KITTI数据集上,该模型能够同时成功定位多个被遮挡物体,并在无需微调的情况下泛化到真实世界场景。
- 消融实验表明,使用局部节点邻域并结合 $3\times3$ 池化核相比全局池化,mAP提升1.7分。
- 标签平滑使性能提升2.3 mAP点,表明其能稳定优化过程并更好地处理不确定性。
- 通过避免遮挡物与被遮挡物之间的中心重叠,mAP提升2.3分,证实该策略在减少误报中的关键作用。
- 该模型能够学习维持多个运动假设(例如对一辆转弯的汽车),展示了在不确定性下的概率推理能力,这对真实世界动态行为至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。