[論文レビュー] OODformer: Out-Of-Distribution Detection Transformer
OODformer は、ビジョントランスフォーマー(ViT)を用いて、グローバルな画像コンテキストと注目に基づく特徴相関を活用することで、OOD一般化の向上を図る、新しい分布外(OOD)検出手法を提案する。ViTの[クラス]トークン埋め込みと信頼度スコアのクラス条件付き類似度を活用することで、OODデータの負のサンプリングや微調整を必要とせず、CIFAR-10/-100およびImageNet30で最先端の性能を達成した。
A serious problem in image classification is that a trained model might perform well for input data that originates from the same distribution as the data available for model training, but performs much worse for out-of-distribution (OOD) samples. In real-world safety-critical applications, in particular, it is important to be aware if a new data point is OOD. To date, OOD detection is typically addressed using either confidence scores, auto-encoder based reconstruction, or by contrastive learning. However, the global image context has not yet been explored to discriminate the non-local objectness between in-distribution and OOD samples. This paper proposes a first-of-its-kind OOD detection architecture named OODformer that leverages the contextualization capabilities of the transformer. Incorporating the trans\-former as the principal feature extractor allows us to exploit the object concepts and their discriminate attributes along with their co-occurrence via visual attention. Using the contextualised embedding, we demonstrate OOD detection using both class-conditioned latent space similarity and a network confidence score. Our approach shows improved generalizability across various datasets. We have achieved a new state-of-the-art result on CIFAR-10/-100 and ImageNet30.
研究の動機と目的
- 安全性が求められるビジョン応用において、モデル性能が著しく低下する分布外(OOD)サンプルを検出するという、重要な課題に対処すること。
- ビジョントランスフォーマー(ViT)が、グローバルな画像コンテキストとオブジェクト属性の共起性を捉える可能性を検討すること。
- 負のサンプリング、対照的損失、OODデータにおける微調整に依存しない、複数のデータセットに一般化可能な手法を開発すること。
- ViTの自己注意メカニズムが、OOD検出に適した意味的にコンパクトな表現を内蔵的に学習することを示すこと。
提案手法
- 標準的な交差エントロピー損失を用いて、教師あり分類のためのビジョントランスフォーマー(ViT)を分布内(ID)データ上で学習する。
- 入力画像のグローバルかつ文脈的な表現として、ViTの最終層における[クラス]トークン埋め込みを抽出する。
- ID埋め込みと各クラスの平均埋め込みとの間で、クラス条件付きの距離尺度(例:コサイン類似度、マハラノビス距離、ユークリッド距離)を計算し、OOD検出に用いる。
- 分類ヘッドからのソフトマックス信頼度スコアを、2番目のOOD検出信号として使用する。
- 複数のベンチマークデータセットで、AUROCなどの標準的な指標を用いてOOD検出性能を評価する。
- 画像の拡大処理を施したか否かに関わらず、ランダムに初期化されたモデルおよびImageNetで事前学習されたモデルを含む、ResNetベースラインと、ViTに基づくOODformerを比較する。
実験結果
リサーチクエスチョン
- RQ1対照的損失や負のサンプリングを明示的に用いずに、ビジョントランスフォーマー(ViT)は分布外サンプルを効果的に検出できるか?
- RQ2ViTに内蔵されたグローバルコンテキストとマルチヘッド自己注意メカニズムは、CNNと比較してOOD一般化を向上させるか?
- RQ3埋め込み空間における距離尺度の選択(コサイン類似度、ユークリッド距離、マハラノビス距離)が、OOD検出性能にどのように影響するか?
- RQ4単純な信頼度ベースおよび埋め込みベースのOOD検出手法が、既存の最先端手法を上回ることができるか?
主な発見
- OODformer は、CIFAR-100 で94.4のAUROCを達成し、最高のResNet-101ベースライン(87.8 AUROC)を著しく上回った。
- 軽量なViTバージョンであるDeiT-Tiny-16でさえ、CIFAR-100 で94.4のAUROCを達成し、サイズが大きく、パラメータ数も多いにもかかわらず、より大きなResNetモデルを上回った。
- 事前学習済みのViTおよびDeiTバージョンは、画像の拡大処理や微調整を経ても、ImageNetで事前学習されたResNetsを一貫して上回り、ViTのinductive biasがOOD検出において優れていることを示した。
- マハラノビス距離尺度が、クラス平均と分散の両方の情報を活用するため、コサイン距離やユークリッド距離をわずかに上回った。
- 距離尺度の選択に対してOODformerは頑健であり、異なる尺度間で性能が±2%以内に収束しており、安定性が確認された。
- モデル容量が増加するにつれて、ViTとResNetの性能差が拡大する傾向にあり、ViTの注目メカニズムが、OOD検出に適した判別力があり文脈に依存する表現をより効果的に捉えられることを示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。