[论文解读] A Survey of Visual Sensory Anomaly Detection
本综述首次对视觉感官异常检测(AD)进行了全面回顾,根据异常形式和监督水平将其分类为基于对象、场景和事件的异常。综述整合了近期的深度学习方法,识别出关键挑战,并提出了若干开放性研究方向,如工业AD的预训练模型、持续学习、3D AD以及语义感知场景生成。
Visual sensory anomaly detection (AD) is an essential problem in computer vision, which is gaining momentum recently thanks to the development of AI for good. Compared with semantic anomaly detection which detects anomaly at the label level (semantic shift), visual sensory AD detects the abnormal part of the sample (covariate shift). However, no thorough review has been provided to summarize this area for the computer vision community. In this survey, we are the first one to provide a comprehensive review of visual sensory AD and category into three levels according to the form of anomalies. Furthermore, we classify each kind of anomaly according to the level of supervision. Finally, we summarize the challenges and provide open directions for this community. All resources are available at https://github.com/M-3LAB/awesome-visual-sensory-anomaly-detection.
研究动机与目标
- 为解决计算机视觉领域中视觉感官异常检测(AD)缺乏全面综述的问题,尤其聚焦于协变量偏移而非语义偏移。
- 基于异常的形式,系统性地将视觉感官AD划分为三个层级:基于对象的异常、基于场景的异常和基于事件的异常。
- 根据监督范式对现有方法进行分类:无监督、弱监督和有监督。
- 识别开放性挑战,并提出推动视觉感官AD在实际应用中发展的未来研究方向。
提出的方法
- 综述将视觉感官AD组织为三种分层形式:基于对象的异常(局部缺陷)、基于场景的异常(场景中的新物体)和基于事件的异常(视频中的异常行为)。
- 根据学习范式对方法进行分类:无监督(自监督、预训练微调、重建、特征建模)、弱监督(不完整/半监督、不精确监督)和有监督(具体结构或织物缺陷)。
- 对于视频级AD,方法进一步按监督方式分组:无监督(如基于GAN、自编码器、运动特征融合)、弱监督(如关系感知CNN、自注意力CRF、时序特征学习)和有监督(如手工特征、在线学习、运动损失)。
- 综述利用MVTec AD、ShanghaiTech和Lost and Found等现有基准数据集,评估方法在不同领域中的性能与一致性。
- 整合了分布外检测和一类分类等相关领域的见解,明确区分了语义偏移与感官(协变量)偏移之间的差异。
- 作者在 https://github.com/M-3LAB/awesome-visual-sensory-anomaly-detection 建立了一个全面的资源仓库,以支持可复现性与社区发展。
实验结果
研究问题
- RQ1如何基于异常形式(对象、场景、事件)和监督水平,对视觉感官异常检测进行系统性分类?
- RQ2在视觉感官AD中,无监督、弱监督和有监督方法之间的关键方法论差异是什么?
- RQ3近期的深度学习方法如何应对域偏移、异常数据有限以及跨未见域泛化等挑战?
- RQ4视觉感官AD中的开放性挑战和未来研究方向是什么,特别是在工业和3D场景中?
- RQ5自监督和预训练模型如何被适配以提升低数据、真实世界异常检测场景下的性能?
主要发现
- 综述指出,视觉感官AD(聚焦于协变量偏移,即局部视觉偏差)与语义AD(标签级偏移)不同,且在以往综述中被显著低估。
- 无监督方法在基于对象的AD中占主导地位,基于重建和自监督的技术(如Li et al., 2021; Sheynin et al., 2021)在MVTec AD上表现出色。
- 弱监督视频AD方法,如使用关系感知CNN(Purwanto et al., 2021)或双路径优化(Wu et al., 2021)的方法,仅需粗略标注即可实现改进的定位性能。
- 有监督视频AD模型,包括使用运动损失(Li et al., 2022)或在线学习(Lu et al., 2018)的方法,在ShanghaiTech等基准上实现了高达1,000–1,200 fps的推理速度和优异的准确性。
- 综述强调,当前的预训练模型(如ImageNet上的ResNet18)在工业AD中引入了域偏差,而基于异常数据进行领域特定的预训练是未来极具前景的方向。
- 3D AD正成为高潜力研究方向,Bergmann et al. (2021) 提出了首个3D数据集,但目前尚无标准基线模型,表明这是关键的开放挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。