Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Weakly Supervised Pre-Training of Visual Perception Models

Mannat Singh, Laura Gustafson|arXiv (Cornell University)|Jan 20, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本論文は、大規模な画像-ハッシュタグペairを用いた視覚認識モデルの弱教師あり事前学習を調査しており、これまでで最大の規模の画像とハッシュタグのデータセットを用いて、最新のResNetアーキテクチャを訓練しています。提案されたSWAGモデルは、転移学習のあらゆる設定で最先端の性能を達成し、自己教師ありおよび完全教師ありのベースラインを上回っており、有害なステレオタイプ的関連性のリスクが最小限に抑えられる強力なゼロショット一般化を示しています。

ABSTRACT

Model pre-training is a cornerstone of modern visual recognition systems. Although fully supervised pre-training on datasets like ImageNet is still the de-facto standard, recent studies suggest that large-scale weakly supervised pre-training can outperform fully supervised approaches. This paper revisits weakly-supervised pre-training of models using hashtag supervision with modern versions of residual networks and the largest-ever dataset of images and corresponding hashtags. We study the performance of the resulting models in various transfer-learning settings including zero-shot transfer. We also compare our models with those obtained via large-scale self-supervised learning. We find our weakly-supervised models to be very competitive across all settings, and find they substantially outperform their self-supervised counterparts. We also include an investigation into whether our models learned potentially troubling associations or stereotypes. Overall, our results provide a compelling argument for the use of weakly supervised learning in the development of visual recognition systems. Our models, Supervised Weakly through hashtAGs (SWAG), are available publicly.

研究の動機と目的

  • ハッシュタグを用いた弱教師あり事前学習が、完全教師ありまたは自己教師あり事前学習のスケーラブルな代替手段として有効であるかを評価すること。
  • 大規模な画像-ハッシュタグペアで学習したモデルが、ゼロショットおよび少数ショット転移を含む下流のビジョンタスクにどれほど一般化するかを評価すること。
  • このようなモデルが、弱教師あり信号から有害なまたはステレオタイプ的な関連性を学習するかどうかを調査すること。
  • 弱教師ありモデルの性能を、最先端の自己教師ありおよび完全教師あり事前学習アプローチと比較すること。

提案手法

  • 複数ラベル分類のための標準的なクロスエントロピー損失を用いて、大規模な画像-ハッシュタグペアデータセット上で最新の残差ネットワークを事前学習すること。
  • 従来のImageNetサイズを超える規模の、公開済みの最大の画像-ハッシュタグペアデータセットを活用して、監視のスケールを拡大すること。
  • 複数の下流ビジョンベンチマーク(ゼロショットおよび少数ショット設定を含む)における転移学習を通じて、得られたモデルを評価すること。
  • ターゲットデータセットに対して微調整を行わず、学習済み特徴を直接使用することでゼロショット転移を実行すること。
  • UTK Faceデータセットを用いて、予測されたハッシュタグと肌の色、年齢、性別、顔貌的ルックなどの文化的属性との関連性を分析することで、系統的なバイアス分析を実施すること。
  • モデルの予測に対する視覚的および統計的分析を実施し、学習された関連性とデータ分布に起因するアーティファクトを区別すること。

実験結果

リサーチクエスチョン

  • RQ1ハッシュタグを用いた弱教師あり事前学習は、下流のビジョンタスクにおいて完全教師ありおよび自己教師あり事前学習と同等の性能を達成できるか?
  • RQ2微調整なしで、ゼロショットおよび少数ショット転移学習設定において、弱教師ありモデルはどの程度の性能を示すか?
  • RQ3これらのモデルは、性別、人種、年齢に関連する問題的またはステレオタイプ的な関連性をどの程度学習するか?
  • RQ4観察された関連性は、モデルの学習によるものか、UTK Faceのようなデータセットにおけるアーティファクトに起因するのか?
  • RQ5同等の規模で学習された場合、弱教師ありモデルの性能は自己教師ありモデルを上回るか?

主な発見

  • 最良のSWAGモデルは、比較的単純なトレーニングパイプラインを用いても、さまざまな視覚認識タスクで最先端のモデルと同等の性能を達成している。
  • SWAGモデルは、ゼロショットおよび少数ショット転移を含む、評価されたすべての転移学習設定において、自己教師あり事前学習ベースラインを顕著に上回っている。
  • モデルは強力なゼロショット一般化を示しており、微調整なしで下流分類タスクにおいて競争力のある正確性を達成している。
  • バイアス分析の結果、一部のステレオタイプ的関連性(例:#mugshot が黒人個人に関連付けられる)が確認されたが、視覚的および統計的分析により、これはモデルの学習によるものではなく、データアーティファクトによる可能性が高いと示された。
  • 「#mugshot」と濃い肌の色の関連性はデータでは裏付けられていない:モデルは最も明るい肌色(Fitzpatrick 1)に対して#mugshotをより頻繁に予測しているため、バイアスは評価データセットに起因している。
  • 全体として、有害な関連性のリスクは言語モデルのそれよりも低く、弱教師あり事前学習は完全教師ありまたは自己教師ありアプローチの代替手段として実用的でかつ頑健であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。