Skip to main content
QUICK REVIEW

[论文解读] Complex-Valued Autoencoders for Object Discovery

Sindy Löwe, Phillip Lippe|arXiv (Cornell University)|Apr 5, 2022
Neural Networks and Applications被引用 9
一句话总结

本文提出复数自编码器(CAE),一种简单、端到端可训练的自编码架构,利用复数激活值来学习分布式、以对象为中心的表征。通过在模长中编码特征存在性、在相对相位差中实现对象绑定——受神经科学时间相关性假说启发——CAE 实现了具有竞争力的无监督对象发现性能,优于以往的复数模型,并且训练速度比当前最先进基于槽(slot-based)的方法快 up to 100 倍。

ABSTRACT

Object-centric representations form the basis of human perception, and enable us to reason about the world and to systematically generalize to new settings. Currently, most works on unsupervised object discovery focus on slot-based approaches, which explicitly separate the latent representations of individual objects. While the result is easily interpretable, it usually requires the design of involved architectures. In contrast to this, we propose a comparatively simple approach - the Complex AutoEncoder (CAE) - that creates distributed object-centric representations. Following a coding scheme theorized to underlie object representations in biological neurons, its complex-valued activations represent two messages: their magnitudes express the presence of a feature, while the relative phase differences between neurons express which features should be bound together to create joint object representations. In contrast to previous approaches using complex-valued activations for object discovery, we present a fully unsupervised approach that is trained end-to-end - resulting in significant improvements in performance and efficiency. Further, we show that the CAE achieves competitive or better unsupervised object discovery performance on simple multi-object datasets compared to a state-of-the-art slot-based approach while being up to 100 times faster to train.

研究动机与目标

  • 为解决基于槽的方法在无监督对象发现中的局限性,如架构复杂性、表达能力有限以及无法表示层次结构。
  • 克服以往复数模型(如深度玻尔兹曼机 DBM)的低效与不稳定性,这些模型需要贪婪预训练和迭代推理。
  • 开发一种简单、端到端可训练的架构,利用时间相关性假说实现分布式、以对象为中心的表征学习。
  • 实现在无架构归纳偏置或迭代推理过程下的高效、可靠且可解释的无监督对象发现。

提出的方法

  • CAE 使用带有复数权重和激活值的卷积自编码器,其中模长编码特征存在性,相位通过相对相位对齐编码对象身份。
  • 在每一层引入可学习的相位偏移操作,显式控制编码与解码过程中特征在神经元间的绑定方式。
  • 使用标准均方误差损失,端到端训练模型,损失函数为实值输入图像与重建复数输出模长之间的差异。
  • 对象身份通过训练后潜在表征的相位值推断得出,无需监督。
  • 通过在潜在相位值上进行 k-means 聚类实现基于相位的对象分离,从而实现解耦的、按对象的重建。
  • 该架构通过直接输出稳定的复数表征,避免了迭代推理,实现快速推理。

实验结果

研究问题

  • RQ1一个简单、端到端的复数自编码器是否能在无架构归纳偏置或迭代推理的情况下,学习到解耦的、以对象为中心的表征?
  • RQ2遵循时间相关性假说的复数激活值是否能带来比以往复数模型更可靠、更可解释的对象发现?
  • RQ3与当前最先进基于槽的方法(如 SlotAttention)相比,CAE 在标准多对象基准上的性能与训练效率如何?
  • RQ4CAE 是否能通过基于相位的分布式绑定有效表示层次或组合式对象结构?

主要发现

  • 在 2Shapes、3Shapes 和 MNIST&Shape 数据集上,CAE 实现了与 SlotAttention 相当或更优的无监督对象发现性能,且训练速度显著更快。
  • CAE 的训练速度比 SlotAttention 快 up to 100 倍,在 2Shapes 数据集上的总训练时间仅为 7.6 分钟,而 SlotAttention 为 759.3 分钟。
  • CAE 在训练速度与可靠性方面均优于 Reichert & Serre (2014) 提出的基于 DBM 的方法,避免了贪婪预训练与迭代收敛过程。
  • CAE 潜在空间中的相位值能可靠地按对象身份分离,如定性相位图与基于 k-means 聚类的按对象重建所示。
  • CAE 的推理时间(263.9 秒)比 SlotAttention 慢 16.6 倍,但由于无需迭代过程,仍保持高效。
  • 实值自编码器基线无法学习到解耦表征,而 CAE 通过基于相位的绑定成功实现对象解耦,证明了复数激活值的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。