Skip to main content
QUICK REVIEW

[論文レビュー] Negative Label Guided OOD Detection with Pretrained Vision-Language Models

Xue Jiang, Feng Liu|arXiv (Cornell University)|Mar 29, 2024
Web Data Mining and Analysis被引用数 4
ひとこと要約

この論文は、大規模コーパスから得られる広範なネガティブラベルを活用して、ビジョン・ランゲージモデルにおける分布外(OOD)検出を向上させる、新しい事後的OOD検出手法NegLabelを提案する。学習されたスコアを用いて、画像がイン・ディストリビューション(ID)ラベルおよびネガティブラベルの両者に対してどれほど類似しているかを測定することで、複数のベンチマークで最先端の性能を達成し、ドメインシフトに対しても強い耐性を示す。特にImageNet-1kでは94.21%のAUROCおよび25.40%のFPR95を達成した。

ABSTRACT

Out-of-distribution (OOD) detection aims at identifying samples from unknown classes, playing a crucial role in trustworthy models against errors on unexpected inputs. Extensive research has been dedicated to exploring OOD detection in the vision modality. Vision-language models (VLMs) can leverage both textual and visual information for various multi-modal applications, whereas few OOD detection methods take into account information from the text modality. In this paper, we propose a novel post hoc OOD detection method, called NegLabel, which takes a vast number of negative labels from extensive corpus databases. We design a novel scheme for the OOD score collaborated with negative labels. Theoretical analysis helps to understand the mechanism of negative labels. Extensive experiments demonstrate that our method NegLabel achieves state-of-the-art performance on various OOD detection benchmarks and generalizes well on multiple VLM architectures. Furthermore, our method NegLabel exhibits remarkable robustness against diverse domain shifts. The codes are available at https://github.com/tmlr-group/NegLabel.

研究の動機と目的

  • ビジョン・ランゲージモデルにおけるテキスト情報を活用する効果的なOOD検出手法の不足を解消すること。
  • 多様なドメインシフト下でも一般化性と耐性を向上させること。
  • 意味的に遠く離れた大量のネガティブラベルを統合することで検出性能を向上させる事後的手法を開発すること。
  • イン・ディストリビューションとネガティブラベルの両者に対する類似度のバランスを取るスコア関数を設計すること。

提案手法

  • イン・ディストリビューション(ID)ラベルとの画像・テキスト類似度に対して正の相関、ネガティブラベルとの類似度に対して負の相関を持つ、新しいOODスコアを提案する。
  • テキスト埋め込み空間におけるコサイン距離を用いて、IDラベルから意味的に乖離した高品質なネガティブラベルを選別するためのNegMiningアルゴリズムを導入する。
  • 推論時に、画像およびテキストエンコーダーを用いて画像・テキスト類似度スコアを計算するため、凍結されたビジョン・ランゲージモデルを採用する。
  • IDラベルおよびネガティブラベルの両方の類似度にわたって正規化を行う、和-ソフトマックスベースのOODスコアを設計し、分離性能を向上させる。
  • 再訓練を伴わずにスコアの安定化と分散の低減を図るため、推論時にグループ化戦略を適用する。
  • プロンプト工学および固定されたテキストエンコーダーを用いることで、一貫性がありスケーラブルな埋め込み計算を確保する。

実験結果

リサーチクエスチョン

  • RQ1大量のネガティブラベルを活用することで、ビジョン・ランゲージモデルにおけるOOD検出性能が向上するか?
  • RQ2IDラベルから意味的に乖離したネガティブラベルは、イン・ディストリビューションとアウト・オブ・ディストリビューションのサンプル間の分離性をどのように向上させるか?
  • RQ3提案されたNegLabel手法は、さまざまなビジョン・ランゲージモデルアーキテクチャおよびベンチマークに一般化可能か?
  • RQ4従来のOOD検出アプローチと比較して、さまざまなドメインシフト下での耐性はどの程度か?
  • RQ5ネガティブラベルがOOD検出に有効である理論的根拠は何か?

主な発見

  • NegLabelは、大規模なImageNet-1k OOD検出ベンチマークで94.21%のAUROCおよび25.40%のFPR95を達成し、多くの完全教師あり手法を上回った。
  • CIFAR-10、CIFAR-100、Tiny-ImageNetを含む、複数のOOD検出ベンチマークで最先端の性能を示した。
  • CLIP、ALIGN、GroupViTを含む多様なビジョン・ランゲージモデルアーキテクチャに、良好な一般化性能を示した。
  • 分布シフトに対して強い耐性を示し、ドメインシフト下でも高い性能を維持した。
  • 理論的分析により、大規模なネガティブラベル設定下でOODスコアが正規分布に収束することが確認され、統計的安定性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。