Skip to main content
QUICK REVIEW

[论文解读] AlignNet: Unsupervised Entity Alignment

Antonia Creswell, Kyriacos Nikiforou|arXiv (Cornell University)|Jul 17, 2020
Multimodal Machine Learning Applications参考文献 35被引用 8
一句话总结

AlignNet 是一种无监督深度学习框架,通过在无真实标签的情况下跨时间对齐实体,解决了视频中的物体对应问题。它使用动力学模型预测物体状态转移,并采用基于 Transformer 的排列模块将当前帧的物体与先前对齐的物体匹配,从而在遮挡和物体重新出现的情况下实现鲁棒跟踪。

ABSTRACT

Recently developed deep learning models are able to learn to segment scenes into component objects without supervision. This opens many new and exciting avenues of research, allowing agents to take objects (or entities) as inputs, rather that pixels. Unfortunately, while these models provide excellent segmentation of a single frame, they do not keep track of how objects segmented at one time-step correspond (or align) to those at a later time-step. The alignment (or correspondence) problem has impeded progress towards using object representations in downstream tasks. In this paper we take steps towards solving the alignment problem, presenting the AlignNet, an unsupervised alignment module.

研究动机与目标

  • 解决视频序列中时间维度上物体级表征的无监督对齐问题。
  • 通过解决连续帧中实体之间的对应关系,实现强化学习与规划中的基于物体的学习。
  • 将对齐方法扩展至部分可观察环境,其中物体可能消失并重新出现。
  • 开发一种记忆增强版本(Memory AlignNet),在长时间遮挡期间维持物体身份的持久性。
  • 消除对真实标签、边界框或特权信息在实体对应关系上的依赖。

提出的方法

  • 使用动力学模型(LSTM)基于先前状态和动作预测先前对齐实体的下一状态表征。
  • 采用基于 Transformer 的排列头计算一个排列矩阵,以重新排序当前帧的实体,使其与先前对齐实体的顺序匹配。
  • 应用学习到的排列矩阵,将当前帧的物体特征与前一时刻对齐的实体对齐。
  • 引入一种基于槽位的 LSTM 记忆模块(Memory AlignNet),用于随时间存储和更新单个物体的表征。
  • 使用预测特征与对齐特征之间的对比损失,端到端地训练整个系统,实现无监督训练。
  • 通过维持积累历史的内存槽,利用物体持续性的归纳偏置,保持每个追踪物体的表征。

实验结果

研究问题

  • RQ1无监督模型是否能在无真实对应关系或边界框的情况下,学习到时间维度上物体级表征的对齐?
  • RQ2当外观相似的物体相互作用或遮挡时,该模型在解决模糊物体身份方面表现如何?
  • RQ3该模型是否能在部分可观察环境中,实现对物体在长时间遮挡和重新出现情况下的追踪?
  • RQ4引入基于槽位的记忆机制是否能提升在动态物体群体任务(如新物体出现、消失、重新出现)中的性能?
  • RQ5与监督或启发式基线相比,该模型在物体对齐和动力学预测方面的性能如何?

主要发现

  • AlignNet 在完全可观察环境(如 2D SpriteWorld 和 3D Physical Concepts: Continuity)中表现优异,通过利用动力学信息在碰撞期间解决了物体身份的模糊性。
  • 在 Physical Concepts: Continuity 任务中,AlignNet 成功处理了短期遮挡、光照变化和视角变化。
  • 在 Unity Room 环境和 Physical Concepts Free-Form 数据集上,Memory AlignNet 显著优于基线模型,尤其在处理新物体出现和重新出现方面表现突出。
  • 通过在内存中保持持久的物体表征,该模型在长时间遮挡后仍能有效应对物体重新出现的情况。
  • 无监督训练方案使得模型无需访问真实标签或边界框即可实现有效对齐,这与大多数再识别或追踪方法不同。
  • 基于槽位的 LSTM 记忆机制成功地在长时间内保持了离散且持久的单个物体表征,从而实现了长时程追踪。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。