[论文解读] OCFormer: One-Class Transformer Network for Image Classification
OCFormer 提出了一种基于视觉 Transformer 的单类分类框架,通过在潜在空间中注入零均值高斯噪声作为伪负样本,增强了表示学习。该方法在 CIFAR-10、CIFAR-100、Fashion-MNIST 和 CelebA 眼镜数据集上实现了最先进性能,相较于现有的基于 CNN 的单类分类器,平均 AUC 提升最高达 6.7%。
We propose a novel deep learning framework based on Vision Transformers (ViT) for one-class classification. The core idea is to use zero-centered Gaussian noise as a pseudo-negative class for latent space representation and then train the network using the optimal loss function. In prior works, there have been tremendous efforts to learn a good representation using varieties of loss functions, which ensures both discriminative and compact properties. The proposed one-class Vision Transformer (OCFormer) is exhaustively experimented on CIFAR-10, CIFAR-100, Fashion-MNIST and CelebA eyeglasses datasets. Our method has shown significant improvements over competing CNN based one-class classifier approaches.
研究动机与目标
- 解决在高度不平衡或偏斜数据集中缺乏负样本时的单类分类挑战。
- 克服传统生成式与判别式方法在高维数据表示中的局限性。
- 利用视觉 Transformer(ViT)的表示能力,提升单类分类性能。
- 通过一种新颖的噪声增强潜在空间策略,缓解深度单类分类器中常见的超球体坍缩问题。
- 证明基于 ViT 的模型在单类分类中的有效性,该领域在以往研究中尚未被充分探索。
提出的方法
- 使用预训练的视觉 Transformer(ViT)作为特征提取器,将输入图像编码为高维潜在空间表征。
- 将零均值高斯噪声作为伪负样本注入潜在空间表征中,以模拟异常数据。
- 使用最优损失函数进行模型训练,该损失函数鼓励正样本的紧凑性并增强与伪负样本噪声的分离。
- 在将特征输入下游分类器头(MLP、SVM 或 KDE)之前,将原始潜在特征与注入的噪声向量进行拼接。
- 采用标准正则化技术,以防止因使用更大规模 ViT 架构导致的过拟合。
- 通过消融研究分析批量大小、潜在维度和分类器深度对模型性能的影响。
实验结果
研究问题
- RQ1视觉 Transformer 是否能在不依赖真实负样本的情况下,有效适应单类图像分类?
- RQ2将零均值高斯噪声作为伪负样本注入,如何改善单类设置下的表示学习?
- RQ3ViT 基于单类分类的最优潜在维度、批量大小和分类器深度配置是什么?
- RQ4在多样化的基准测试中,OCFormer 与最先进单类分类器在 AUC 性能上的对比如何?
- RQ5在单类分类任务中,基于 ViT 的特征提取是否比基于 CNN 的方法具有更好的泛化能力?
主要发现
- OCFormer 使用 ViT-large 在 CIFAR-10、CIFAR-100、Fashion-MNIST 和 CelebA 眼镜数据集上实现了 96.58% 的平均 AUC,优于所有基线模型。
- 使用 ViT-base 和 1000 维潜在空间时,OCFormer 在 CIFAR-10 上实现了 98.72% 的 AUC-ROC,显著优于对比学习和 PANDA 方法。
- 在所有实验中,潜在维度 D=1000 均显著优于 D=4096,表明更高维的噪声注入可能降低性能。
- 随着 MLP 分类器深度增加,性能起初下降,随后提升,表明优化景观具有非单调特性。
- Grad-CAM 可视化结果证实,注意力机制聚焦于目标异常(眼镜),验证了模型的可解释性与相关性。
- 在 CIFAR-10 和 CIFAR-100 上使用 MLP 和 SVM 分类器时,OCFormer 相较于竞争方法实现了 6.7% 的相对 AUC 提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。