[论文解读] GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection
该论文提出 GPT-4V-AD,一种利用 GPT-4V 的视觉问答(VQA)能力实现零样本异常检测的框架,通过细粒度区域划分、提示工程和文本到分割的结合实现。该方法在 VisA 上达到 88.0 AU-ROC 的最先进性能,在 MVTec AD 上也取得优异结果,证明了 GPT-4V 在异常检测中视觉定位的潜力,尽管其在像素级精度方面仍存在局限。
Large Multimodal Model (LMM) GPT-4V(ision) endows GPT-4 with visual grounding capabilities, making it possible to handle certain tasks through the Visual Question Answering (VQA) paradigm. This paper explores the potential of VQA-oriented GPT-4V in the recently popular visual Anomaly Detection (AD) and is the first to conduct qualitative and quantitative evaluations on the popular MVTec AD and VisA datasets. Considering that this task requires both image-/pixel-level evaluations, the proposed GPT-4V-AD framework contains three components: extbf{ extit{1)}} Granular Region Division, extbf{ extit{2)}} Prompt Designing, extbf{ extit{3)}} Text2Segmentation for easy quantitative evaluation, and have made some different attempts for comparative analysis. The results show that GPT-4V can achieve certain results in the zero-shot AD task through a VQA paradigm, such as achieving image-level 77.1/88.0 and pixel-level 68.0/76.6 AU-ROCs on MVTec AD and VisA datasets, respectively. However, its performance still has a certain gap compared to the state-of-the-art zero-shot method, \eg, WinCLIP and CLIP-AD, and further researches are needed. This study provides a baseline reference for the research of VQA-oriented LMM in the zero-shot AD task, and we also post several possible future works. Code is available at \url{https://github.com/zhangzjn/GPT-4V-AD}.
研究动机与目标
- 探究使用以 VQA 为导向的大型多模态模型(如 GPT-4V)实现零样本异常检测的可行性。
- 解决使用通用视觉-语言模型进行像素级定位的异常检测挑战。
- 通过定量和定性评估,为基于 VQA 的 LMM 在零样本异常检测中建立基线。
- 探索 GPT-4V 在处理细粒度异常定位和可复现性方面的局限性。
提出的方法
- 细粒度区域划分通过网格采样、语义分割(SAM)或超像素方法,将输入图像划分为语义或结构一致的区域。
- 提示设计通过制定特定任务的 VQA 提示,引导 GPT-4V 识别每个区域内的异常。
- 文本到分割通过结合区域边界聚合 GPT-4V 的区域级输出,重建像素级异常掩码。
- 该框架通过标准基准上的 AU-ROC 指标,支持图像级和像素级的评估。
- 消融研究比较不同区域划分策略,评估其对检测精度的影响。
- 通过相同输入的多次推理,评估可复现性和稳定性。
实验结果
研究问题
- RQ1像 GPT-4V 这类面向 VQA 的大型多模态模型是否能在无需微调或异常特异性提示的情况下,实现有效的零样本异常检测?
- RQ2区域划分策略的选择(网格、SAM、超像素)如何影响异常定位的质量?
- RQ3在 MVTec AD 和 VisA 的零样本设置下,GPT-4V 对未见缺陷类型的泛化能力如何?
- RQ4为何在少样本设置下,GPT-4V 未能有效利用额外的正常参考图像,尽管这些图像有潜力提升性能?
- RQ5GPT-4V 在相同输入下多次推理的输出是否稳定且一致?
主要发现
- GPT-4V-AD 在 MVTec AD 上达到 77.1 AU-ROC,在 VisA 上达到 88.0 AU-ROC(图像级),优于 VisA 上的 SOTA 方法 CLIP-AD,提升 +6.8 AU-ROC。
- 像素级性能在 MVTec AD 上达到 68.0 AU-ROC,在 VisA 上达到 76.6 AU-ROC,表明 GPT-4V 尽管存在局限,仍具备一定的视觉定位能力。
- 在大多数情况下,基于超像素的区域划分策略在分割结果上优于网格或 SAM,尤其适用于小尺寸或结构细微的缺陷。
- GPT-4V 未能有效利用额外的正常参考图像,常产生不一致或错误的输出。
- 模型输出稳定性较低,相同输入在多次运行中区域数量和置信度分数存在微小差异。
- 定性结果表明,GPT-4V 能将异常定位在接近真实标注的位置,显示出强大的视觉-语言对齐能力,但在细粒度或低对比度缺陷上表现吃力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。