Skip to main content
QUICK REVIEW

[論文レビュー] Masked Siamese Networks for Label-Efficient Learning

Mahmoud Assran, Mathilde Caron|arXiv (Cornell University)|Apr 14, 2022
Domain Adaptation and Few-Shot Learning被引用数 8
ひとこと要約

マスクドシアンズネットワーク(MSN)は、ピクセル単位の再構成を避けて、マスクされた画像のビューとその元の未マスクビューに対して類似した表現を生成する自己教師あり学習フレームワークを提案する。このアプローチにより、ラベル効率学習において最先端の性能を達成し、1%のラベル(10×小さいモデルを用いて)を用いてImageNet-1Kで75.7%のトップ1精度を達成した。

ABSTRACT

We propose Masked Siamese Networks (MSN), a self-supervised learning framework for learning image representations. Our approach matches the representation of an image view containing randomly masked patches to the representation of the original unmasked image. This self-supervised pre-training strategy is particularly scalable when applied to Vision Transformers since only the unmasked patches are processed by the network. As a result, MSNs improve the scalability of joint-embedding architectures, while producing representations of a high semantic level that perform competitively on low-shot image classification. For instance, on ImageNet-1K, with only 5,000 annotated images, our base MSN model achieves 72.4% top-1 accuracy, and with 1% of ImageNet-1K labels, we achieve 75.7% top-1 accuracy, setting a new state-of-the-art for self-supervised learning on this benchmark. Our code is publicly available.

研究の動機と目的

  • ラベル効率の悪い画像分類におけるスケーラビリティと性能を向上させる自己教師あり学習手法の開発。
  • マスクドオートエンコーダーにおいてピクセルレベルやトークンレベルの再構成を避けるが、同時に意味的表現の質を維持すること。
  • パッチマスキングを用いることで計算量とメモリを削減し、ビジョントランスフォーマーの効率的な事前学習を可能にすること。
  • ラベル効率の悪い表現学習におけるビュー不変性とデータ拡張の役割の調査。
  • 明示的な再構成損失なしに、ジョイントエンベッディングアーキテクチャが競争力のある性能を達成できることの実証。

提案手法

  • MSNはシアンズアーキテクチャを用い、画像の一方のビューをランダムにマスク(70%のパッチを削除)し、もう一方のビューは未マスクのままにしている。
  • モデルは両ビューに対して同一の表現を出力するように学習され、コントラスト損失を用いる。これにより、表現レベルでの間接的ノイズ除去が実現される。
  • エンコーダーはビジョントランスフォーマー(ViT)であり、未マスクパッチのみを処理するため、事前学習中の計算コストが顕著に削減される。
  • 色のずれ、クロップ、反転、ぼかしなどのデータ拡張を両ビューに適用することで、色統計に基づくショートカット学習を防ぐ。
  • 事前学習には、ランダムマスキングを伴うグローバルビューと、コントラスト学習用の追加的なフォーカルビュー(小サイズのクロップ)を用い、再構成損失は一切使用しない。
  • このフレームワークはスケーラブルである:過酷なマスキングによりメモリ使用量が減少し、トレーニング速度が向上し、少ないGPUでも事前学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ピクセルレベルの再構成を避けても、高品質な意味的表現を学習できる自己教師あり手法は可能か?
  • RQ2ラベル効率の悪い画像分類において、マスクドシアンズ学習はマスクドオートエンコーディングに比べてどのように優れているか?
  • RQ3過酷なパッチマスキングは、ViTベースのアーキテクチャにおけるトレーニング効率とモデルスケーラビリティを向上させるか?
  • RQ4データ拡張によるビュー不変性は、ラベル効率の悪い一般化においてどのような役割を果たすか?
  • RQ5ジョイントエンベッディングアーキテクチャは、再構成損失なしにラベル効率学習で最先端の性能を達成できるか?

主な発見

  • 1%のラベル(13,000枚の画像)を用いたImageNet-1Kで、ViT-B/4モデルを用いたMSNは75.7%のトップ1精度を達成し、新たな最先端を樹立した。
  • 5,000枚のラベル画像のみを用いても、ベースMSNモデルは72.4%のトップ1精度を達成し、優れたラベル効率性能を示した。
  • 8億パラメータを必要とした先行SOTA手法と比較して、MSNはほぼ10倍少ないパラメータ数で優れた性能を達成した。
  • 70%のパッチドロップ率を適用した過酷なマスキングにより、GPUメモリ使用量が1GPUあたり26Gから17Gに削減され、スループットは415枚/秒から600枚/秒に向上した。
  • アノテーションとターゲットの両方に異なる拡張処理(色のずれ、クロップ、反転、ぼかし)を適用することで、1%のImageNetで精度が7.0%から52.3%に上昇した。これはビュー不変性の重要性を示している。
  • より大きなモデルでは、より高いマスキング比が効果を発揮する:ViT-L/16は50%のマスキングで70.1%のトップ1精度を達成し、過酷なマスキングでも性能が安定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。