[论文解读] Image Representation Learning Using Graph Regularized Auto-Encoders
本文提出了一种图正则化自编码器(GAE),通过结合深度自编码与图正则化器,学习低维、局部不变的图像表征,从而在 ORL、Yale 和 COIL20 数据集上,在无监督和半监督设置下均实现了图像聚类的最先进性能。
We consider the problem of image representation for the tasks of unsupervised learning and semi-supervised learning. In those learning tasks, the raw image vectors may not provide enough representation for their intrinsic structures due to their highly dense feature space. To overcome this problem, the raw image vectors should be mapped to a proper representation space which can capture the latent structure of the original data and represent the data explicitly for further learning tasks such as clustering. Inspired by the recent research works on deep neural network and representation learning, in this paper, we introduce the multiple-layer auto-encoder into image representation, we also apply the locally invariant ideal to our image representation with auto-encoders and propose a novel method, called Graph regularized Auto-Encoder (GAE). GAE can provide a compact representation which uncovers the hidden semantics and simultaneously respects the intrinsic geometric structure. Extensive experiments on image clustering show encouraging results of the proposed algorithm in comparison to the state-of-the-art algorithms on real-word cases.
研究动机与目标
- 为解决从高维图像数据中学习保留关键语义和结构信息的低维图像表征的挑战。
- 通过图正则化引入局部几何结构,改进无监督和半监督图像表征学习。
- 开发一种深度非线性映射方法,利用图正则化器保持从输入空间到表征空间的局部不变性——即保留邻域关系。
- 在图像聚类任务中超越现有的深度表征学习和局部不变方法。
- 研究图正则化和深度架构在完全标记和部分标记场景下对表征质量的影响。
提出的方法
- 使用多层深度自编码器学习输入图像 X 的非线性低维表征 H,其中 H ∈ ℝ^{l×n} 且 l < m。
- 应用图正则化器以强制实现局部不变性:表征 H 通过保持邻域关系,保留原始数据流形的局部欧氏几何结构。
- 在输入数据 X 上构建 K 近邻(KNN)图以定义局部邻域,边权重基于相似性(例如,高斯 RBF)。
- 在半监督设置中引入半图正则化器,通过为连接标记点与其邻居的边分配更高权重,将标记数据纳入考虑。
- 使用组合损失函数优化自编码器:重建误差(||X - Q||²)加上惩罚局部结构偏离的图正则化项。
- 通过网格搜索调整超参数(λ 表示图正则化强度,k 表示 KNN 数量),以最大化聚类性能。
实验结果
研究问题
- RQ1与标准自编码器相比,带有图正则化的深度自编码器是否能通过保留局部流形结构学习到更具判别性的图像表征?
- RQ2通过图正则化引入局部几何约束,如何改善无监督图像表征学习中的聚类性能?
- RQ3通过半图正则化器引入标记数据,在半监督设置下在多大程度上提升了表征学习?
- RQ4与 CNMF 及稀疏/去噪自编码器等最先进方法相比,所提出的 GAE 在聚类准确率和互信息方面表现如何?
- RQ5架构深度和图正则化对所学习图像表征质量的影响是什么?
主要发现
- 在 ORL 数据集上,GAE 在使用 40 个标记样本的半监督学习中,平均聚类准确率达到 0.8163,互信息为 0.8923,显著优于 CNMF(AC: 0.7140,MI: 0.8050)。
- 在 Yale 数据集上,GAE 在使用 15 个标记样本的半监督学习中,互信息为 0.6547,准确率为 0.6828,显著优于 CNMF(MI: 0.5704,AC: 0.6120)。
- 在 COIL20 数据集上,GAE 在使用 20 个标记样本的半监督学习中,互信息为 0.9109,准确率为 0.8961,优于 CNMF(MI: 0.7728,AC: 0.7270)。
- 在无监督聚类中,GAE 在 ORL 上的平均准确率为 0.7203,在 Yale 上为 0.6944,在 COIL20 上为 0.7461,表现出与最先进方法相当的竞争力。
- 半监督 GAE 始终优于其无监督版本,表明在结合图正则化时,标记数据能增强表征学习。
- 消融研究证实,图正则化显著提升了性能,尤其是在标记数据稀缺时,其对保留局部结构的作用尤为关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。