[論文レビュー] Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
本サーベイは、ビジョン・ランゲージ・モデル(VLM)および大規模ビジョン・ランゲージ・モデル(LVLM)時代における、一般化された分布外検出(OOD検出)、異常検出(AD)、新奇性検出(ND)、オープンセット認識(OSR)、外れ値検出(OD)を統合するフレームワーク「Generalized Out-of-Distribution Detection v2」を紹介する。このフレームワークは、CLIP や GPT-4V といったモデルが引き起こしたパラダイムシフトに伴い、OOD検出とADが主な課題として浮上したことを明らかにし、VLMおよびLVLM時代における定義の進化、ベンチマーク、手法、今後の研究方向性について包括的なレビューを提供する。
Detecting out-of-distribution (OOD) samples is crucial for ensuring the safety of machine learning systems and has shaped the field of OOD detection. Meanwhile, several other problems are closely related to OOD detection, including anomaly detection (AD), novelty detection (ND), open set recognition (OSR), and outlier detection (OD). To unify these problems, a generalized OOD detection framework was proposed, taxonomically categorizing these five problems. However, Vision Language Models (VLMs) such as CLIP have significantly changed the paradigm and blurred the boundaries between these fields, again confusing researchers. In this survey, we first present a generalized OOD detection v2, encapsulating the evolution of these fields in the VLM era. Our framework reveals that, with some field inactivity and integration, the demanding challenges have become OOD detection and AD. Then, we highlight the significant shift in the definition, problem settings, and benchmarks; we thus feature a comprehensive review of the methodology for OOD detection and related tasks to clarify their relationship to OOD detection. Finally, we explore the advancements in the emerging Large Vision Language Model (LVLM) era, such as GPT-4V. We conclude with open challenges and future directions. The resource is available at https://github.com/AtsuMiyai/Awesome-OOD-VLM.
研究の動機と目的
- ビジョン・ランゲージ・モデル(VLM)の文脈において、分布外検出(OOD)検出、異常検出(AD)、新奇性検出(ND)、オープンセット認識(OSR)、外れ値検出(OD)という5つの密接に関連するタスクを、1つの進化し続けるフレームワークに統合・再定式化すること。
- CLIP や GPT-4V といったVLMがもたらしたパラダイムシフトが、これらのタスク間の伝統的な境界を曇らせ、分野の核心的課題を再定義したことを分析すること。
- 特にVLMベースの手法を踏まえて、OOD検出および関連タスクの定義、問題設定、ベンチマークの進化を明確にすること。
- VLM時代におけるOOD検出および関連タスクの手法を体系的にレビューし、主な技術、ベースライン、未解決問題を強調すること。
- 今後の研究方向性、特に解けない問題検出(UPD)、実世界のベンチマーク、LVLM挙動の理論的理解を特定・提示すること。
提案手法
- VLM時代の進化する状況を反映するため、OOD検出、AD、ND、OSR、ODを1つの分類法に統合・再分類する新しい統合フレームワーク「Generalized OOD Detection v2」を提唱する。
- CLIP などのVLMを用いたOOD検出および関連タスクの進化をレビューし、定義、問題設定、ベンチマーク手法の変化を分析する。
- VLM時代におけるOOD検出手法を、特徴ベース、ログティックベース、不確実性推定技術に分類・比較し、CLIPベースおよびLVLMベースのアプローチに重点を置く。
- 大規模事前学習モデルとパラメータ効率の良い微調整(例:DSGF)を活用した単モodal OOD検出の利用を強調し、OOD研究における事前学習の広範な採用を提唱する。
- ImageNet-ES や WILDS といった実世界ベンチマークの導入と評価を通じて、標準ベンチマークと実世界のデータシフトのギャップを埋めること。
- 今後の方向性として、LVLM応答の不確実性(パーキュリティ)を用いた解けない問題検出(UPD)の提案、MuirBench などの多様なベンチマークへのUPDの統合、LVLMのロバストネスに関する理論的分析を提唱する。
実験結果
リサーチクエスチョン
- RQ1CLIP や GPT-4V といったモデルを含むVLM時代において、OOD検出、AD、ND、OSR、OD の定義および問題設定はどのように進化したか?
- RQ2VLMおよびLVLMを用いたOOD検出における主な手法的進歩は何か? また、従来の単モダリティ手法とはどのように異なるか?
- RQ3なぜ一部の分野がVLM時代において活発でなくなり、統合されたのか? 今後の主要な課題は何か?
- RQ4ImageNet-ES や WILDS といった実世界ベンチマークは、安全に重要なアプリケーションにおけるOOD検出の評価をどのように改善できるか?
- RQ5LVLM時代における新たな研究方向性、特に解けない問題検出(UPD)について、それらを形式化・評価する方法は何か?
主な発見
- Generalized OOD Detection v2 フレームワークは、VLM時代においてOOD検出と異常検出(AD)が主な課題として浮上した一方で、ND や OSR の分野は特徴の明確な違いが薄れたり統合されたりしていることを明らかにした。
- CLIP などのVLMの登場により、OOD検出、AD、ND、OSR、OD の間の境界が著しく曇り、それらの関係性と相違点を明確にするための統合フレームワークの必要性が生じた。
- CLIPベースのOOD検出は、対照学習とゼロショット一般化を活用する主流のパラダイムとなったが、標準ベンチマークと実世界のデータシフトのギャップを埋めるために、ImageNet-ES などの実世界ベンチマークの導入が不可欠である。
- DSGF などのパラメータ効率の良い微調整技術は、大規模事前学習モデルを活用した単モダリティ OOD 検出において有望な成果を示しているが、閉集合分類と比較して、この分野はまだ十分に研究が進んでいない。
- GPT-4V や LLaVA といったLVLMの登場により、オブジェクトレベルの検出やセグメンテーションを含む、OOD検出の新たなフロンティアが開かれた。特に MCM などの手法と組み合わせることで顕著である。
- 解けない問題検出(UPD)は、今後の重要な課題として特定され、応答のパーキュリティやモデルに依存しない後処理手法を用いた解決策の可能性が示された。また、MuirBench などの多様なベンチマークへのUPDの統合は、堅牢な評価のためには不可欠である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。