Skip to main content
QUICK REVIEW

[论文解读] Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey

Atsuyuki Miyai, Jingkang Yang|arXiv (Cornell University)|Jul 31, 2024
Text and Document Classification Technologies被引用 4
一句话总结

本综述介绍了广义分布外检测 v2(Generalized Out-of-Distribution Detection v2),这是一个统一框架,用于视觉语言模型(Vision Language Model, VLM)和大视觉语言模型(Large Vision Language Model, LVLM)时代下的分布外检测(OOD)、异常检测(AD)、新奇检测(ND)、开放集识别(OSR)和离群点检测(OD)。该综述揭示,由于CLIP和GPT-4V等模型引发的范式转变,OOD检测与AD已成为主要挑战,并对VLM和LVLM时代下相关任务的定义演变、基准测试、方法论以及未来研究方向进行了全面回顾。

ABSTRACT

Detecting out-of-distribution (OOD) samples is crucial for ensuring the safety of machine learning systems and has shaped the field of OOD detection. Meanwhile, several other problems are closely related to OOD detection, including anomaly detection (AD), novelty detection (ND), open set recognition (OSR), and outlier detection (OD). To unify these problems, a generalized OOD detection framework was proposed, taxonomically categorizing these five problems. However, Vision Language Models (VLMs) such as CLIP have significantly changed the paradigm and blurred the boundaries between these fields, again confusing researchers. In this survey, we first present a generalized OOD detection v2, encapsulating the evolution of these fields in the VLM era. Our framework reveals that, with some field inactivity and integration, the demanding challenges have become OOD detection and AD. Then, we highlight the significant shift in the definition, problem settings, and benchmarks; we thus feature a comprehensive review of the methodology for OOD detection and related tasks to clarify their relationship to OOD detection. Finally, we explore the advancements in the emerging Large Vision Language Model (LVLM) era, such as GPT-4V. We conclude with open challenges and future directions. The resource is available at https://github.com/AtsuMiyai/Awesome-OOD-VLM.

研究动机与目标

  • 在视觉语言模型(VLM)背景下,将五个密切相关任务——分布外检测(OOD)、异常检测(AD)、新奇检测(ND)、开放集识别(OSR)和离群点检测(OD)——统一并重新构架为一个持续演化的单一框架。
  • 分析由CLIP等VLM和GPT-4V等LVLM引发的范式转变,这些模型模糊了传统上这些任务之间的界限,并重新定义了该领域中的核心挑战。
  • 澄清OOD检测及相关任务在VLM方法背景下的定义、问题设定和基准测试的演变,尤其关注VLM相关方法。
  • 对VLM时代OOD检测及相关任务的方法论进行系统性综述,突出关键技术、基线方法和开放性问题。
  • 识别并概述未来研究方向,包括不可解问题检测(UPD)、真实世界基准测试,以及LVLM行为的理论理解。

提出的方法

  • 提出一种新的统一框架——广义OOD检测v2,将OOD检测、AD、ND、OSR和OD整合并重新分类于单一分类体系下,以反映VLM时代下的演变格局。
  • 利用CLIP等VLM回顾OOD检测及相关任务的演变,分析定义、问题设定和基准测试实践的转变。
  • 对VLM时代OOD检测的方法进行分类与比较,包括基于特征的方法、基于logit的方法以及不确定性估计技术,特别关注基于CLIP和LVLM的方法。
  • 强调利用大规模预训练模型和参数高效微调(如DSGF)在单模态OOD检测中的应用,并倡导在OOD研究中更广泛地采用预训练策略。
  • 引入并评估真实世界基准(如ImageNet-ES和WILDS),以弥合标准基准与真实世界数据分布偏移之间的差距。
  • 提出未来方向,包括利用LVLM响应困惑度实现不可解问题检测(UPD)、将UPD集成到MuiraBench等多样化基准中,以及对LVLM鲁棒性的理论分析。

实验结果

研究问题

  • RQ1在VLM时代,特别是基于CLIP和GPT-4V等模型,OOD检测、AD、ND、OSR和OD的定义与问题设定如何演变?
  • RQ2基于VLM和LVLM的OOD检测有哪些关键方法论进展?它们与传统单模态方法有何不同?
  • RQ3为何某些领域在VLM时代变得不再活跃或被整合?当前的主要挑战是什么?
  • RQ4真实世界基准(如ImageNet-ES和WILDS)如何提升在安全关键应用中OOD检测的评估效果?
  • RQ5在LVLM时代,新兴研究方向(特别是不可解问题检测UPD)是什么?如何形式化并评估这些方向?

主要发现

  • 广义OOD检测v2框架表明,在VLM时代,OOD检测与异常检测(AD)已成为主要挑战,而ND和OSR等其他领域则因界限模糊或被整合而显著减弱其独立性。
  • CLIP等VLM的出现显著模糊了OOD检测、AD、ND、OSR和OD之间的界限,迫切需要一个统一框架来明确其关系与差异。
  • 基于CLIP的OOD检测已成为主导范式,其方法依赖对比学习与零样本泛化能力,但亟需ImageNet-ES等真实世界基准来弥合标准基准与真实世界数据分布偏移之间的差距。
  • 参数高效微调技术(如DSGF)在利用大规模预训练模型进行单模态OOD检测方面展现出潜力,但该领域相较于闭集分类仍处于研究不足状态。
  • GPT-4V和LLaVA等LVLM的出现,使OOD检测进入新前沿,尤其在目标级检测与分割方面,当与MCM等方法结合时更为显著。
  • 不可解问题检测(UPD)被识别为一项关键新兴挑战,潜在解决方案包括利用响应困惑度和模型无关的后处理方法,且将UPD集成到MuiraBench等多样化基准中对于实现稳健评估至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。