Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Relevance Maps of Vision Transformers Improves Robustness

Hila Chefer, Idan Schwartz|arXiv (Cornell University)|Jun 2, 2022
CCD and CMOS Imaging Sensors被引用数 11
ひとこと要約

本論文は、ビジョントランスフォーマー(ViTs)の関連性マップを最適化する微調整手法を提案し、背景ではなく前景オブジェクトに注目させるようにモデルの注目を向けることで、ドメインシフトに対する耐性を向上させる。わずかなペアド画像と前景マスク(自己教師付きViTによって自動生成)を用いて、背景の関連性を低くし、前景のカバー範囲を広げ、高い信頼性を促進する3つの損失項を導入することで、元の精度を損なわずに分布外データセットでの精度が著しく向上する。

ABSTRACT

It has been observed that visual classification models often rely mostly on the image background, neglecting the foreground, which hurts their robustness to distribution changes. To alleviate this shortcoming, we propose to monitor the model's relevancy signal and manipulate it such that the model is focused on the foreground object. This is done as a finetuning step, involving relatively few samples consisting of pairs of images and their associated foreground masks. Specifically, we encourage the model's relevancy map (i) to assign lower relevance to background regions, (ii) to consider as much information as possible from the foreground, and (iii) we encourage the decisions to have high confidence. When applied to Vision Transformer (ViT) models, a marked improvement in robustness to domain shifts is observed. Moreover, the foreground masks can be obtained automatically, from a self-supervised variant of the ViT model itself; therefore no additional supervision is required.

研究の動機と目的

  • データセットバイアスや誤った相関関係により、ViTsが背景の手がかりに過度に依存する問題に対処すること。
  • 注目メカニズムを操作して前景オブジェクトに注目させることで、分布シフトに対するモデルの耐性を向上させること。
  • 人為的アノテーションデータを最小限に抑え、自己教師付きの前景マスクを用いる微調整手法を開発すること。
  • 元のトレーニング分布における分類精度を維持しつつ、分布外データへの一般化性能を向上させること。
  • 微調整後、モデルに依存しない後処理手法として、ViTベースの分類器の解釈可能性と耐性を向上させること。

提案手法

  • 微小な画像-マスクペアのセットを用いて、事前学習済みViTに対して微調整手順を適用し、3つの異なる損失項を有する。
  • 最初の損失は、背景領域に割り当てられた関連性スコアを最小化し、オブジェクトに注目するよう促進する。
  • 2番目の損失は、関連性マップにおける前景オブジェクトの広範囲なカバーを促進し、スパarsity(疎性)を低減する。
  • 3番目の損失は、元のモデルがトレーニング分布上で達成する分類精度を維持するための正則化子として機能する。
  • 前景マスクは自己教師付きViTの変種を用いて取得され、人為的アノテーションマスクの必要性を排除する。
  • この手法はトレーニング後に行われ、再訓練やアーキテクチャの変更を必要としない。

実験結果

リサーチクエスチョン

  • RQ1ViTの関連性マップを最適化することで、背景の手がかりへの依存を減らし、ドメインシフトに対する耐性を向上させられるか?
  • RQ2少量の画像-マスクペアが、インドメイン性能を劣化させることなく、モデルの一般化性能をどの程度向上させられるか?
  • RQ3自己教師付きの前景マスク生成が、人為的アノテーションの負担なしにこの手法を可能にする有効性はどの程度か?
  • RQ4この手法の失敗事例は、オブジェクトサイズ、文脈依存性、またはクラスレアネスとどのように関連しているか?
  • RQ5注目マップを人間が認識するオブジェクト領域により近づけることで、解釈可能性が向上するか?

主な発見

  • 本手法は、ImageNet-A、ImageNet-R、ImageNet-Sketch、SI-Scoreといった分布外データセットで分類精度が著しく向上し、特にドメインシフトが顕著なベンチマークで顕著な向上を示す。
  • ImageNet-A(極めて分布外のテストセット)では、予測の信頼性を維持したまま耐性が向上する。
  • 微調整済みモデルが生成する関連性マップは、前景オブジェクトに注目するよう著しく改善され、背景の支配的影響が減少する。
  • 小さなオブジェクトや文脈依存性の高いオブジェクトのクラスでは、元のモデルが背景の手がかりに依存していた場合に特に大きな性能向上が見られる。
  • 元のImageNetデータセットにおける精度の低下は最小限に抑えられ、インドメイン性能の効果的な維持が示された。
  • 失敗事例は限定的で、通常はレアクラスや曖昧な前景(例:注意を散らす前景を持つプールテーブル、ミニチュア・プードルとトイ・プードルのように類似した犬種)に関連している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。