[论文解读] Unsupervised Learning of Compositional Energy Concepts
COMET 提出了一种无监督框架,将组合性视觉概念表示为独立的能量函数,从而实现对全局(例如光照、天气)和局部(例如物体身份、颜色)变化因素的联合建模。通过优化这些能量函数的总和,COMET 能够通过概念重组生成图像,并在不同数据集和模态之间泛化,展示了所学组件在无监督条件下的跨数据集和跨模态组合能力。
Humans are able to rapidly understand scenes by utilizing concepts extracted from prior experience. Such concepts are diverse, and include global scene descriptors, such as the weather or lighting, as well as local scene descriptors, such as the color or size of a particular object. So far, unsupervised discovery of concepts has focused on either modeling the global scene-level or the local object-level factors of variation, but not both. In this work, we propose COMET, which discovers and represents concepts as separate energy functions, enabling us to represent both global concepts as well as objects under a unified framework. COMET discovers energy functions through recomposing the input image, which we find captures independent factors without additional supervision. Sample generation in COMET is formulated as an optimization process on underlying energy functions, enabling us to generate images with permuted and composed concepts. Finally, discovered visual concepts in COMET generalize well, enabling us to compose concepts between separate modalities of images as well as with other concepts discovered by a separate instance of COMET trained on a different dataset. Code and data available at https://energy-based-model.github.io/comet/.
研究动机与目标
- 开发一种无监督方法,在统一框架中发现全局和局部视觉概念。
- 实现不同数据集和模态之间概念的组合,例如将一个数据集中的面部表情与另一个数据集中的光照组合。
- 将视觉因素表示为能量函数,使包含该因素的场景获得低能量,否则获得高能量,从而实现基于优化的图像生成。
- 将解缠因子的发现扩展到真实且多样的数据集,超越合成数据或有限领域基准。
- 证明所学组件在不同数据分布和模态之间的泛化能力,包括图像到图像和跨数据集的重新组合。
提出的方法
- COMET 将每个视觉概念表示为一个能量函数,该函数对包含该因素的图像赋予低能量,否则赋予高能量。
- 通过能量函数的重新组合实现图像重建,从而在无需标注监督的情况下发现能量函数。
- 图像生成被表述为最小化所有能量函数之和的优化过程,最低能量状态可重建输入图像。
- 使用带有位置嵌入的深度神经网络学习能量函数,以保留空间结构,而移除位置嵌入则有助于发现全局因素。
- 一个在某个数据集上训练的 COMET 模型的组件可与在另一数据集上训练的另一个 COMET 模型的组件组合,实现跨数据集泛化。
- 使用多模态数据集(例如 CelebA-HQ 与 Danbooru,KITTI 与 Virtual KITTI)进行 COMET 训练,并验证跨领域的一致性分解与重新组合。
实验结果
研究问题
- RQ1无监督方法是否能在统一的能量基础框架中同时发现全局和局部视觉因素?
- RQ2COMET 是否能够跨不同数据集组合概念,例如将 CLEVR 中的物体身份与 CLEVR Lighting 中的光照组合?
- RQ3在一种模态(如人脸图像)上发现的能量函数能否与另一模态(如汽车图像)上的能量函数有意义地重新组合?
- RQ4COMET 的组件在多样的数据分布和模态之间泛化得如何?
- RQ5COMET 在无监督条件下对光照、面部表情和物体身份等因子的解缠程度如何?
主要发现
- COMET 在单一无监督框架中成功发现了全局因素(如光照)和局部因素(如物体身份和面部表情),定性分析证实了因子归因的正确性。
- 该模型通过最小化所有能量函数之和的优化过程实现图像生成,最低总能量状态可重建输入图像。
- COMET 展示了跨数据集的组合能力:来自 CLEVR 和 CLEVR Toy 的组件可重新组合,生成包含混合物体类型的新型图像。
- 在 CelebA-HQ 和 Danbooru 上训练的 COMET 组件在不同模态间保持一致的解缠,可选择性地操控头发颜色、肤色和面部表情等属性。
- COMET 能够泛化到多模态数据集,实现将 KITTI 的光照与 Virtual KITTI 的物体特征组合,展示了跨领域因子的组合能力。
- 尽管存在一些纠缠现象(例如重建中的光照伪影),COMET 在同时建模全局和局部因素方面仍优于先前的无监督方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。