[论文解读] Visual Anomaly Detection via Dual-Attention Transformer and Discriminative Flow
本文提出 DADF,一种新颖的视觉异常检测框架,结合基于双注意力 Transformer 的两级重建(自注意力与记忆注意力)与判别性归一化流,以建模先验特征与重建特征的联合似然。该方法在 Mvtec AD 上实现 98.3/98.4 的图像/像素 AUROC,在 Mvtec LOCO AD 上实现 83.7 的图像 AUROC,通过协同对应与判别机制展现出卓越的异常检测与定位能力。
In this paper, we introduce the novel state-of-the-art Dual-attention Transformer and Discriminative Flow (DADF) framework for visual anomaly detection. Based on only normal knowledge, visual anomaly detection has wide applications in industrial scenarios and has attracted significant attention. However, most existing methods fail to meet the requirements. In contrast, the proposed DTDF presents a new paradigm: it firstly leverages a pre-trained network to acquire multi-scale prior embeddings, followed by the development of a vision Transformer with dual attention mechanisms, namely self-attention and memorial-attention, to achieve two-level reconstruction for prior embeddings with the sequential and normality association. Additionally, we propose using normalizing flow to establish discriminative likelihood for the joint distribution of prior and reconstructions at each scale. The DADF achieves 98.3/98.4 of image/pixel AUROC on Mvtec AD; 83.7 of image AUROC and 67.4 of pixel sPRO on Mvtec LOCO AD benchmarks, demonstrating the effectiveness of our proposed approach.
研究动机与目标
- 解决现有无监督视觉异常检测方法仅依赖重建或基于嵌入的差异性所导致的局限性,这些方法因过度泛化或判别能力不足而产生误判。
- 通过在协同框架中整合对应机制(重建)与判别机制(似然建模),提升检测可靠性。
- 通过利用预训练网络的多尺度先验嵌入并应用双注意力机制,增强特征表示的鲁棒性与两极重建能力。
- 通过在联合特征分布上使用归一化流将重建误差替换为判别性似然,更有效地建模正常性。
- 通过多尺度特征融合与联合似然估计,在标准基准上实现 SOTA 性能。
提出的方法
- 该框架首先使用预训练主干网络(如 ResNet18)提取多尺度先验嵌入,以保留分层上下文信息。
- 引入双分支视觉 Transformer,结合自注意力与记忆注意力机制,执行两级重建:一项使用先验特征,另一项使用正常原型的记忆库。
- 重建过程建立顺序性与与正常性相关的对应机制,降低因过度重建导致的误报。
- 在先验特征与两种重建特征(自重建与记忆重建)的联合分布上应用判别性归一化流,建模正常性的似然,而非依赖重建误差。
- 归一化流输出的似然作为更可靠的异常分数,增强正常与异常样本之间的判别能力。
- 多尺度特征独立处理,其结果通过融合提升定位精度与检测准确率。
实验结果
研究问题
- RQ1具有自注意力与记忆注意力机制的双注意力 Transformer 是否能提升视觉异常检测中重建的稳定性与对应保真度?
- RQ2通过归一化流对先验特征与重建特征的联合似然进行建模,是否能比基于重建误差的方法实现更可靠的异常检测?
- RQ3多尺度特征融合如何影响异常定位与检测的性能?
- RQ4协同使用对应(重建)与判别(似然建模)机制是否能降低误报与漏报?
- RQ5自重建与基于记忆的重建对整体性能的相对贡献如何?其融合如何提升检测效果?
主要发现
- DADF 框架在 Mvtec AD 基准上实现 98.3 的图像 AUROC 与 98.4 的像素 AUROC,创下新的 SOTA 性能。
- 在 Mvtec LOCO AD 基准上,DADF 实现 83.7 的图像 AUROC 与 67.4 的像素 sPRO,显著优于先前方法。
- 与基于重建误差的方法相比,判别性归一化流在 Mvtec AD 上带来 +3.2/+1.2/+2.1 的性能提升,而在 Mvtec LOCO AD 上提升更大(+7.9 与 +21.2)。
- 结合自重建与记忆重建特征的联合判别流模型(ϕ_D)在 Mvtec AD 上相比仅使用先验的基线流(ϕ_P)实现 +1.7/+3.5 的图像/像素 AUROC 提升。
- 多尺度特征融合提升检测性能,其中第 3 尺度产生最佳单尺度结果,而全多尺度融合实现整体最优性能。
- 双重建策略(自重建与基于记忆的重建)同时降低误报与漏报:自重建保留纹理细节,记忆重建提升稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。