Skip to main content
QUICK REVIEW

[論文レビュー] LMC: Large Model Collaboration with Cross-assessment for Training-Free Open-Set Object Recognition

Haoxuan Qu, Xiaofei Hui|arXiv (Cornell University)|Sep 22, 2023
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本稿では、スパurious-discriminative特徴への依存を軽減するため、市販の大規模モデル同士の協調的推論を活用する、再訓練を必要としないオープンセット物体認識のフレームワークであるLMCを提案する。CLIPとChatGPTの間で相互フィードバックを行うサイクル型クロス評価モジュールを採用することで、再訓練なしに複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Open-set object recognition aims to identify if an object is from a class that has been encountered during training or not. To perform open-set object recognition accurately, a key challenge is how to reduce the reliance on spurious-discriminative features. In this paper, motivated by that different large models pre-trained through different paradigms can possess very rich while distinct implicit knowledge, we propose a novel framework named Large Model Collaboration (LMC) to tackle the above challenge via collaborating different off-the-shelf large models in a training-free manner. Moreover, we also incorporate the proposed framework with several novel designs to effectively extract implicit knowledge from large models. Extensive experiments demonstrate the efficacy of our proposed framework. Code is available https://github.com/Harryqu123/LMC

研究の動機と目的

  • 物体認識における閉じたセットとオープンセットのクラスを混同するスパurious-discriminative特徴に依存する問題に対処すること。
  • 追加のデータやファインチューニングを必要とせず、多様な大規模モデルが内蔵するimplicit知識を活用する再訓練不要のフレームワークを開発すること。
  • 仮想のオープンセットクラスをシミュレートすることで、スパurious特徴への過剰適合を回避するようモデルを誘導し、オープンセット認識のロバスト性を向上させること。
  • 新たなクロス評価および精錬メカニズムを通じて、大規模モデルからimplicit知識を効果的に抽出すること。

提案手法

  • LMCは、CLIPとChatGPTといった複数の事前学習済み大規模モデルを、画像・テキスト表現を交換することで協調させ、特徴理解を向上させる。
  • サイクル型クロス評価モジュールは、画像記述を交互に精錬する:CLIPが画像特徴を生成し、それをもとにテキストプロンプトを改善し、精錬されたプロンプトを再び画像表現の生成に使用する。
  • 仮想のオープンセットクラスは、テキストから画像を生成するパイプラインを用いてシミュレートされ、モデルが既知のクラスを超えて一般化するよう誘導する。
  • CLIPが視覚的整合性を提供し、ChatGPTが意味的根拠を提供する二重ブランチアーキテクチャを採用し、反復的なフィードバックで両モodalを精錬する。
  • クロス評価プロセス中に対照的損失が適用され、生成された画像・テキストペアが望ましいクラスの意味と一致するように整列される。
  • 本手法は推論専用モードで動作し、デプロイ後は再訓練やトレーニングデータへのアクセスを一切不要とする。

実験結果

リサーチクエスチョン

  • RQ1異なる事前学習パラダイムを持つ大規模モデルが、ファインチューニングなしに協調してオープンセット物体認識を向上させられるか?
  • RQ2大規模モデルから得られるimplicit知識を、どのように効果的に抽出・活用できるか?
  • RQ3仮想のオープンセットクラスは、オープンセット認識におけるスパurious-discriminative特徴への依存をどの程度軽減できるか?
  • RQ4サイクル型クロス評価メカニズムは、より良いオープンセット一般化を実現するための画像・テキスト表現の質を向上させるか?
  • RQ5仮想オープンセットクラスと実際の評価用オープンセットクラスの重複が少ない場合でも、フレームワークは高い性能を維持できるか?

主な発見

  • LMCはTinyImageNetで93.1のAUROCを達成し、ソフトマックスベースライン(83.5)や他のバリエーションを大きく上回る最先端の性能を示した。
  • シミュレートされた仮想オープンセットに含まれないオープンセットクラス(サブセットB)に対しても、LMCは86.5のAUROCを達成し、単なるクラスマッチングを超えたロバスト性を示した。
  • サイクル型クロス評価モジュールにより、スパurious-discriminative特徴への依存が低減されたことが、画像に「hornがついている」や「beakがついている」といった記述が正しくオープンセットとして分類される質的結果から明らかになった。
  • 4つの評価プロトコルすべてで強力な性能を維持しており、一般化能力の高さが確認された。
  • 可視化結果から、クロス評価モジュールが生成画像の質を顕著に向上させ、ターゲットクラスをより適切に表現するようになったことが示された。
  • シミュレートされた仮想オープンセットクラスと実際の評価用オープンセットクラスの重複が最小限(≤3.4%)であっても、本手法は有効であることが示され、直接的なマッチングに依存していないことが証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。