[論文レビュー] MOS: Towards Scaling Out-of-distribution Detection for Large Semantic Space
本稿では、大規模な意味的空間を概念的に類似したグループに分解することで意思決定境界を単純化する、グループベースの分布外(OOD)検出フレームワークであるMOS(Minimum Others Score)を提案する。グループ単位のソフトマックスに専用の「others」カテゴリを組み込み、すべてのグループにおける最小信頼度を計算することで、従来手法と比較して14.33%低い平均FPR95と6倍速い推論速度を達成し、ImageNet-1kで最先端の性能を実現した。
Detecting out-of-distribution (OOD) inputs is a central challenge for safely deploying machine learning models in the real world. Existing solutions are mainly driven by small datasets, with low resolution and very few class labels (e.g., CIFAR). As a result, OOD detection for large-scale image classification tasks remains largely unexplored. In this paper, we bridge this critical gap by proposing a group-based OOD detection framework, along with a novel OOD scoring function termed MOS. Our key idea is to decompose the large semantic space into smaller groups with similar concepts, which allows simplifying the decision boundaries between in- vs. out-of-distribution data for effective OOD detection. Our method scales substantially better for high-dimensional class space than previous approaches. We evaluate models trained on ImageNet against four carefully curated OOD datasets, spanning diverse semantics. MOS establishes state-of-the-art performance, reducing the average FPR95 by 14.33% while achieving 6x speedup in inference compared to the previous best method.
研究の動機と目的
- CIFARのような小さなデータセットを超えてテストされていない現行手法に起因する、大規模画像分類における分布外検出の重要なギャップを埋める。
- 数千の意味的クラスを含む高次元クラス空間を効果的に処理できるスケーラブルなOOD検出フレームワークを開発する。
- 類似した概念のグループ化によって意思決定境界を単純化することで、高次元意味的空間における不確実性を低減する。
- 補助の外れデータを必要とせず、大規模な設定でも検出性能と推論効率の両方を向上させる。
- 将来の大規模OOD検出研究のための現実的なベンチマークを可能にする、多様で高解像度のOOD評価データセットを整備する。
提案手法
- 意味的類似性に基づいて大規模意味的空間をより小さな意味的整合性の高いグループに分割し、意思決定境界の複雑さを低減する。
- 各グループ内での確率分布を計算するグループ単位のソフトマックスを導入し、各グループごとのOOD可能性を示す専用の「others」カテゴリを含める。
- 「others」カテゴリの全グループにおける最小信頼度として、最小othersスコア(MOS)を定義し、最終的なOODスコアとする。
- MOSスコアを用いて、すべてのグループで「others」カテゴリに高い信頼度を示す入力をOODと特定し、真のグループにおいて「others」カテゴリに低い信頼度を示す入力をin-distributionと区別する。
- OOD検出性能を維持しつつ効率を向上させるために、事前学習済みのBiT-Sモデルの上位全結合層のみを微調整する。
- ImageNet-1kで学習されたモデルにこのフレームワークを適用し、多様な意味的性質を持つ4つの高解像度OODデータセットで評価する。

実験結果
リサーチクエスチョン
- RQ11,000クラス以上の大きな画像分類設定において、従来の小規模ベンチマーク向けに設計された手法と比較して、OOD検出性能を顕著に向上させることができるか?
- RQ2意味的に類似したクラスをグループ化することで、高次元意味的空間におけるOOD意思決定境界が単純化され、不確実性が低減するか?
- RQ3MOSスコア関数は、MSP、ODIN、KLマッチングといった従来のOOD検出手法と比較して、精度と推論速度の両面で優れているか?
- RQ4異なるグループ化戦略、モデルアーキテクチャ、微調整設定が、大規模設定におけるOOD検出性能に与える影響は何か?
- RQ5補助の外れデータや複雑な学習手順を必要とせず、グループベースのフレームワークが最先端の性能を達成できるか?
主な発見
- MOSは、4つの多様なOODデータセットにおいて、従来の最高手法と比較して平均FPR95が14.33%低く、優れた検出性能を示した。
- 検出精度を維持または向上させつつ、推論時間を6倍高速化したため、実世界の展開において極めて効率的である。
- 上位の全結合層のみを微調整すると、より深い層を微調整するよりも優れたOOD検出性能が得られ、ラベルの過学習リスクが低減することが示唆された。
- グループベースのアプローチは、MSP や KL マッチングといったベースライン手法を著しく上回り、クラス数が50から1,000に増加するに従ってその優位性が顕著になった。
- 実世界の高解像度データベースから収集した、多様で現実的なOOD評価データセットは、合成的または簡略化されたベンチマークよりも、大規模OOD検出のためのより現実的なベンチマークを提供した。
![Figure 2 : OOD detection performance of a common baseline MSP [ 16 ] decreases rapidly as the number of ImageNet-1k classes increases ( left : AUROC; right : FPR95).](https://ar5iv.labs.arxiv.org/html/2105.01879/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。