Skip to main content
QUICK REVIEW

[論文レビュー] The Robustness Limits of SoTA Vision Models to Natural Variation

Mark Ibrahim, Quentin Garrido|arXiv (Cornell University)|Oct 24, 2022
Advanced Vision and Imaging被引用数 8
ひとこと要約

本論文は、3Dウェアハウスオブジェクトを用いて、ポーズ、サイズ、照明、背景、位置の自然な変化に対する最先端の視覚モデルの耐性限界を、700万枚を超える制御された画像変種からなる新規データセットを用いて調査している。アーキテクチャや事前学習の進展にもかかわらず、モデルはこうした変化に対して依然として脆く、耐性が向上するのは、訓練インスタンスの顕著な割合(≥50%)が変動を示す場合に限る。また、類似クラスが変動を経験しても、類似しないクラスへの一般化は失敗する。

ABSTRACT

Recent state-of-the-art vision models introduced new architectures, learning paradigms, and larger pretraining data, leading to impressive performance on tasks such as classification. While previous generations of vision models were shown to lack robustness to factors such as pose, it's unclear the extent to which this next generation of models are more robust. To study this question, we develop a dataset of more than 7 million images with controlled changes in pose, position, background, lighting, and size. We study not only how robust recent state-of-the-art models are, but also the extent to which models can generalize variation in factors when they're present during training. We consider a catalog of recent vision models, including vision transformers (ViT), self-supervised models such as masked autoencoders (MAE), and models trained on larger datasets such as CLIP. We find out-of-the-box, even today's best models are not robust to common changes in pose, size, and background. When some samples varied during training, we found models required a significant portion of diversity to generalize -- though eventually robustness did improve. When diversity is only seen for some classes however, we found models did not generalize to other classes, unless the classes were very similar to those seen varying during training. We hope our work will shed further light on the blind spots of SoTA models and spur the development of more robust vision models.

研究の動機と目的

  • 最先端の視覚モデルがポーズ、サイズ、照明、背景、位置の自然な変化に対してどれほど耐性があるかを評価すること。
  • 特にクラス間で変動が制限されている場合に、訓練データの変動性が、未観測の変化への一般化に与える影響を評価すること。
  • 異なるアーキテクチャ、訓練パラダイム、事前学習データスケールが耐性に与える影響を比較すること。
  • ある要因の変動が、他の要因への耐性に良い影響を及えるかどうかを調査すること。
  • 訓練時に変動を経験したクラスに類似したクラスへの耐性の一般化がどの程度可能かを特定すること。

提案手法

  • 3Dウェアハウスオブジェクトを用いて、ポーズ、サイズ、照明、背景、位置の変動を制御した700万枚を超える画像の大型データセットを構築した。
  • 標準的手順に従い、微調整と線形評価を用いてモデルを評価した。
  • ViT、MAE、CLIP、iBOT、ResNetsなど、さまざまな事前学習データと微調整戦略を用いたSOTAモデルのカタログを訓練・評価した。
  • 訓練インスタンスの要因固有の変動を示す割合を系統的に変化させ、その耐性への影響を調査した。
  • 訓練時に変動を経験したクラスとの類似度に基づき、クラス間での一般化ギャップを測定した。
  • ある要因を変動させた際の他の要因への影響を測定することで、クロス要因効果を分析した。

実験結果

リサーチクエスチョン

  • RQ1最先端の視覚モデルは、ポーズ、サイズ、照明、背景、位置の自然な変化に対してどれほど耐性があるか?
  • RQ2訓練データの変動性(特に一部のクラスに限定された場合)が、要因およびクラス間の一般化にどの程度影響を与えるか?
  • RQ3ある要因(例:ポーズ)の変動が、他の要因(例:照明や背景)への耐性を向上させるか?
  • RQ4訓練時に変動を経験したクラスとは類似しないクラスへのモデルの性能はどのように一般化されるか?
  • RQ5モデルが要因全体にわたり耐性ある性能を達成するためには、最低限どの程度の訓練変動が必要か?

主な発見

  • 最高の最先端モデルでさえ、未観測の背景変化に対してテストされた際、最大48.09%の精度低下を示し、耐性が著しく低いことが判明した。
  • 耐性ギャップを埋めるには、少なくとも訓練インスタンスの50%が要因の変動を示す必要があり、この閾値未満では改善が見られなかった。
  • 変動が一部のクラスに限定されている場合、類似しないクラスへの一般化は著しく劣り、iBot-21kでは背景変化に対して平均で-57.96%の精度ギャップを示した。
  • ある要因(例:ポーズ)の変動が、他の要因(例:照明やサイズ)への耐性を向上させ、全モデルでクロス要因の効果が観察された。
  • 訓練時に変動を経験したクラスに類似したクラスへの一般化が最も良く、クラス類似度が低下するにつれて性能は急激に低下し、特に類似度が低いクラスで最大の低下が見られた。
  • 微調整は線形評価に比べて耐性を低下させる傾向にあり、より多くの事前学習データが耐性を向上させるが、アーキテクチャや訓練パラダイムの影響は小さい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。