[论文解读] Visual Concepts Tokenization
本文提出视觉概念分词(VCT),一种基于Transformer的无监督框架,通过交叉注意力和一种新颖的视觉概念解耦损失,将图像中的视觉概念解耦为一组独立的、与顺序无关的概念标记。VCT在解耦表征学习与场景分解任务中达到最先进性能,在CLEVR数据集上ARI达0.923,在Tetris数据集上MSC达0.760,同时支持通过语言对齐的标记操作实现零样本图像编辑与重组。
Obtaining the human-like perception ability of abstracting visual concepts from concrete pixels has always been a fundamental and important target in machine learning research fields such as disentangled representation learning and scene decomposition. Towards this goal, we propose an unsupervised transformer-based Visual Concepts Tokenization framework, dubbed VCT, to perceive an image into a set of disentangled visual concept tokens, with each concept token responding to one type of independent visual concept. Particularly, to obtain these concept tokens, we only use cross-attention to extract visual information from the image tokens layer by layer without self-attention between concept tokens, preventing information leakage across concept tokens. We further propose a Concept Disentangling Loss to facilitate that different concept tokens represent independent visual concepts. The cross-attention and disentangling loss play the role of induction and mutual exclusion for the concept tokens, respectively. Extensive experiments on several popular datasets verify the effectiveness of VCT on the tasks of disentangled representation learning and scene decomposition. VCT achieves the state of the art results by a large margin.
研究动机与目标
- 开发一种通用的无监督框架,从原始像素中学习解耦的视觉概念,无需人工标注监督。
- 将解耦表征学习与场景分解统一于单一架构中,同时捕捉对象级与属性级视觉概念。
- 确保概念标记独立、与顺序无关且可重构,满足完备性、解耦性与无序性。
- 通过使用预训练CLIP对概念标记进行语言对齐操作,实现零样本图像编辑与重组。
- 在最小化超参数调优的前提下,将框架扩展至大规模数据集。
提出的方法
- VCT采用基于Transformer的架构,包含概念分词器与概念重分词器,利用可学习的概念原型作为查询,通过交叉注意力从图像标记中提取视觉信息。
- 概念标记之间不使用自注意力机制,确保无信息泄露,从而保持解耦性并支持标记顺序的无序性。
- 提出一种新颖的视觉概念解耦损失,强制实现互斥性:修改一个概念标记仅应影响重构图像中对应视觉变化。
- 图像标记通过交叉注意力逐层处理,概念标记不使用位置嵌入,以维持无序性与独立性。
- 框架使用预训练的CLIP图像编码器作为分词器,并利用CLIP的文本编码器实现语言对齐的编辑与视觉概念解码。
- 概念标记在图像间共享,并通过端到端训练表示数据驱动的视觉概念,如对象形状、颜色、尺度与背景。
实验结果
研究问题
- RQ1纯粹无监督的注意力机制框架能否学习到独立且与顺序无关的解耦视觉概念标记?
- RQ2所提出的框架能否在解耦表征学习与场景分解任务中同时达到最先进性能?
- RQ3能否通过操纵语言对齐的视觉标记实现零样本图像编辑与重组?
- RQ4该框架是否能在不依赖显式监督或预定义模板的前提下学习到有意义的数据驱动视觉概念?
- RQ5视觉概念解耦损失在强制实现概念变化之间互斥性方面的有效性如何?
主要发现
- VCT在CLEVR数据集上取得0.923的ARI,在Tetris数据集上取得0.760的平均分割覆盖度(MSC),优于COMET(0.916 ARI,0.713 MSC)、MONET(0.873 ARI,0.701 MSC)与Slot Attention(0.818 ARI,0.750 MSC)。
- 该框架通过在不同场景间替换概念标记,实现零样本图像重组,可生成训练数据中对象数量更多的分布外图像。
- 对单个概念标记(如对象大小)进行线性插值,可产生平滑且语义有意义的图像过渡,证明了连续且解耦的控制能力。
- 在使用CLIP文本编码器进行文本提示解码时,VCT能成功区分对象类型(如球体、立方体、圆柱体)与属性层级(如小、大)。
- 在Objects-Room数据集上,VCT同时捕捉了对象身份与全局因素(如背景与地板颜色),而COMET在处理此类全局属性时表现不佳。
- 由于概念标记之间无自注意力机制,且采用共享原型的交叉注意力机制,推理效率显著提升:每张图像仅需一次前向传播,无论对象数量多少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。