Skip to main content
QUICK REVIEW

[论文解读] OCFormer: One-Class Transformer Network for Image Classification

Prerana Mukherjee, Chandan Kumar Roy|arXiv (Cornell University)|Apr 25, 2022
Retinal Imaging and Analysis被引用 5
一句话总结

OCFormer 提出了一种基于视觉 Transformer 的单类分类框架,通过在潜在空间中注入零均值高斯噪声作为伪负样本,增强了表示学习。该方法在 CIFAR-10、CIFAR-100、Fashion-MNIST 和 CelebA 眼镜数据集上实现了最先进性能,相较于现有的基于 CNN 的单类分类器,平均 AUC 提升最高达 6.7%。

ABSTRACT

We propose a novel deep learning framework based on Vision Transformers (ViT) for one-class classification. The core idea is to use zero-centered Gaussian noise as a pseudo-negative class for latent space representation and then train the network using the optimal loss function. In prior works, there have been tremendous efforts to learn a good representation using varieties of loss functions, which ensures both discriminative and compact properties. The proposed one-class Vision Transformer (OCFormer) is exhaustively experimented on CIFAR-10, CIFAR-100, Fashion-MNIST and CelebA eyeglasses datasets. Our method has shown significant improvements over competing CNN based one-class classifier approaches.

研究动机与目标

  • 解决在高度不平衡或偏斜数据集中缺乏负样本时的单类分类挑战。
  • 克服传统生成式与判别式方法在高维数据表示中的局限性。
  • 利用视觉 Transformer(ViT)的表示能力,提升单类分类性能。
  • 通过一种新颖的噪声增强潜在空间策略,缓解深度单类分类器中常见的超球体坍缩问题。
  • 证明基于 ViT 的模型在单类分类中的有效性,该领域在以往研究中尚未被充分探索。

提出的方法

  • 使用预训练的视觉 Transformer(ViT)作为特征提取器,将输入图像编码为高维潜在空间表征。
  • 将零均值高斯噪声作为伪负样本注入潜在空间表征中,以模拟异常数据。
  • 使用最优损失函数进行模型训练,该损失函数鼓励正样本的紧凑性并增强与伪负样本噪声的分离。
  • 在将特征输入下游分类器头(MLP、SVM 或 KDE)之前,将原始潜在特征与注入的噪声向量进行拼接。
  • 采用标准正则化技术,以防止因使用更大规模 ViT 架构导致的过拟合。
  • 通过消融研究分析批量大小、潜在维度和分类器深度对模型性能的影响。

实验结果

研究问题

  • RQ1视觉 Transformer 是否能在不依赖真实负样本的情况下,有效适应单类图像分类?
  • RQ2将零均值高斯噪声作为伪负样本注入,如何改善单类设置下的表示学习?
  • RQ3ViT 基于单类分类的最优潜在维度、批量大小和分类器深度配置是什么?
  • RQ4在多样化的基准测试中,OCFormer 与最先进单类分类器在 AUC 性能上的对比如何?
  • RQ5在单类分类任务中,基于 ViT 的特征提取是否比基于 CNN 的方法具有更好的泛化能力?

主要发现

  • OCFormer 使用 ViT-large 在 CIFAR-10、CIFAR-100、Fashion-MNIST 和 CelebA 眼镜数据集上实现了 96.58% 的平均 AUC,优于所有基线模型。
  • 使用 ViT-base 和 1000 维潜在空间时,OCFormer 在 CIFAR-10 上实现了 98.72% 的 AUC-ROC,显著优于对比学习和 PANDA 方法。
  • 在所有实验中,潜在维度 D=1000 均显著优于 D=4096,表明更高维的噪声注入可能降低性能。
  • 随着 MLP 分类器深度增加,性能起初下降,随后提升,表明优化景观具有非单调特性。
  • Grad-CAM 可视化结果证实,注意力机制聚焦于目标异常(眼镜),验证了模型的可解释性与相关性。
  • 在 CIFAR-10 和 CIFAR-100 上使用 MLP 和 SVM 分类器时,OCFormer 相较于竞争方法实现了 6.7% 的相对 AUC 提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。