Skip to main content
QUICK REVIEW

[論文レビュー] BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers

Zhiliang Peng, Dong Li|arXiv (Cornell University)|Aug 12, 2022
Advanced Neural Network Applications被引用数 114
ひとこと要約

BEiT v2 は、知識蒸馴を用いてマスクされた画像モデリングの意味ターゲットを提供するベクトル量子化ビジュアル・トークナイザーを導入し、パッチ集約戦略を追加してグローバル表現を強化する; ImageNet分類とADE20Kセマンティック分割で最先端の結果を達成。

ABSTRACT

Masked image modeling (MIM) has demonstrated impressive results in self-supervised representation learning by recovering corrupted image patches. However, most existing studies operate on low-level image pixels, which hinders the exploitation of high-level semantics for representation models. In this work, we propose to use a semantic-rich visual tokenizer as the reconstruction target for masked prediction, providing a systematic way to promote MIM from pixel-level to semantic-level. Specifically, we propose vector-quantized knowledge distillation to train the tokenizer, which discretizes a continuous semantic space to compact codes. We then pretrain vision Transformers by predicting the original visual tokens for the masked image patches. Furthermore, we introduce a patch aggregation strategy which associates discrete image patches to enhance global semantic representation. Experiments on image classification and semantic segmentation show that BEiT v2 outperforms all compared MIM methods. On ImageNet-1K (224 size), the base-size BEiT v2 achieves 85.5% top-1 accuracy for fine-tuning and 80.1% top-1 accuracy for linear probing. The large-size BEiT v2 obtains 87.3% top-1 accuracy for ImageNet-1K (224 size) fine-tuning, and 56.7% mIoU on ADE20K for semantic segmentation. The code and pretrained models are available at https://aka.ms/beitv2.

研究の動機と目的

  • 意味視覚トークナイザーを用いて、ピクセルレベルから意味レベルへとマスク済み画像モデリングを促進する。
  • 学習可能なコードブックを用いて意味空間を離散化する VQ-KD トークナイザーを訓練する。
  • パッチ集約戦略を導入してグローバル表現を改善することで BEiT の事前学習を強化する。
  • ImageNet分類(ファインチューニングおよび Linear Probe)と ADE20K セマンティックセグメンテーションで BEiT v2 を経験的に検証する。
  • モデルサイズと事前学習スケジュールを横断する堅牢性と転移性を実証する。

提案手法

  • ViT エンコーダが画像をパッチ特徴にマップし、コードブックが最も近いコードを選択し、デコーダがコサイン類似度を教師信号として使用して教師特徴を再構成する、VQ-KD で視覚トークナイザーを訓練する。
  • VQ-KD でセマンティック指針を提供するために OpenAI CLIP-B/16 を教師として使用し、エンコーダを量子化器を介して逆伝播させるためにストップグラディエントを適用する。
  • BEiT v2 による事前学習では、マスクされたパッチの離散視覚トークンを予測し、40% のマスク比とパッチ単位のトークン予測に従う。
  • [CLS] トークンがパッチ情報を集約するよう促進し、局所パッチ表現をグローバルな画像表現と整合させるパッチ集約メカニズムを導入する。
  • 標準の MIM 損失(視覚トークンの再構築)と、グローバル表現の質を促進する CLS に焦点を当てた損失を組み合わせた事前学習目的。
  • 任意で前提学習中に浅い Transformer デコーダを追加して CLS ベースのグローバル表現を強化するが、推論コストは増加しない。

実験結果

リサーチクエスチョン

  • RQ1意味的でベクトル量子化されたビジュアル・トークナイザーはピクセルレベルの目標よりもマスク済み画像モデリングを改善できるか?
  • RQ2パッチ集約戦略はMIM事前学習においてより良いグローバル画像表現を促進するか?
  • RQ3BEiT v2 はモデルサイズと事前学習期間に応じて ImageNet ファインチューニング、線形プローブ、および ADE20K セマンティック分割でどう性能を発揮するか?
  • RQ4VQ-KD のターゲット選択(DINO/CLIP)が下流性能に与える影響は?
  • RQ5BEiT v2 は異なる下流評価設定と頑健性ベンチマークに対してどれだけ堅牢か?

主な発見

  • BEiT v2 は ViT-B/16 で 300 epochs の訓練で ImageNet-1K のトップ-1 ファインチューニング精度 85.0%、ADE20k mIoU は 52.7% に達する。
  • BEiT v2 は ViT-B/16 で 1600 epochs の訓練で 85.5%(ImageNetトップ-1)と 53.1% ADE20k mIoU を達成;中間的な ImageNet-21k ファインチューニングで 86.5% および 53.5% に精度が向上。
  • BEiT v2 は ViT-L/16 で 300 epochs の訓練で 86.6% トップ-1(ImageNet)、55.0% ADE20k mIoU を達成;1600 epochs では 87.3% トップ-1 および 56.7% ADE20k mIoU。
  • ImageNet-1K での線形プロービングは BEiT v2 が 80.1% トップ-1 を達成し、報告された比較において BEiT、CAE、MVP、MoCo v3 を上回る。
  • BEiT v2 は MAE と比較して ImageNet のバリアント(Adversarial、Rendition、Sketch)において強い堅牢性を示し、いくつかの設定で大幅な利得を得ている。
  • アブレーション研究は、より深い VQ-KD デコーダがコードブックの使用と下流性能を低下させる一方、より小さなコードブックは使用と精度を改善することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。