[論文レビュー] A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision
この論文は、自然言語のキャプションの簡素化版であるBag-of-Words(BoW)キャプション—構文的構造を除去し、語の順序をシャッフルしたバージョン—が、転送可能な視覚モデルの訓練における有効な教師信号として機能することを示している。この方法により、完全なキャプションで訓練されたモデルと同等のゼロショット画像分類性能が達成され、300万枚の画像-キャプションペアで学習したモデルがImageNet-1kのゼロショットで31.5%のトップ1正答率を達成した。これは1500万ペアで学習したCLIPと同等の性能である。
Using natural language as a supervision for training visual recognition models holds great promise. Recent works have shown that if such supervision is used in the form of alignment between images and captions in large training datasets, then the resulting aligned models perform well on zero-shot classification as downstream tasks2. In this paper, we focus on teasing out what parts of the language supervision are essential for training zero-shot image classification models. Through extensive and careful experiments, we show that: 1) A simple Bag-of-Words (BoW) caption could be used as a replacement for most of the image captions in the dataset. Surprisingly, we observe that this approach improves the zero-shot classification performance when combined with word balancing. 2) Using a BoW pretrained model, we can obtain more training data by generating pseudo-BoW captions on images that do not have a caption. Models trained on images with real and pseudo-BoW captions achieve stronger zero-shot performance. On ImageNet-1k zero-shot evaluation, our best model, that uses only 3M image-caption pairs, performs on-par with a CLIP model trained on 15M image-caption pairs (31.5% vs 31.3%).
研究の動機と目的
- 画像-キャプションペアにおける自然言語の教師信号のどの要素がゼロショット視覚分類に不可欠であるかを調査すること。
- 構文的でない簡素化されたキャプション、例えばBag-of-Words(BoW)が、完全なキャプションに置き換えられても性能が低下しないかを特定すること。
- キャプションのない未対応画像を活用する方法を検討し、疑似BoWキャプションを生成することで訓練データを拡張すること。
- 自己学習に類似したフレームワークを用いて、実際のラベル付きデータと疑似ラベル付きデータを組み合わせることで、ゼロショット一般化性能を向上させること。
- 視覚言語モデルが言語的構造にどれほど頑健であるか、およびテキストエンコーダーの不変性が果たす役割を理解すること。
提案手法
- 語の順序をシャッフルしたり、位置や頻度に基づいて語を削除したり、限定的な語彙を用いたりして、完全なキャプションをBag-of-Words(BoW)に変形する。
- 単モodalの自己教師的事前学習を実施:視覚エンコーダーにはBYOL、テキストエンコーダーにはBERTを用い、入力の摂動に対して頑健性を向上させる。
- BoWキャプションにおける共通語の過剰代表を軽減するため、語の頻度バランスを適用し、モデルの一般化性能を向上させる。
- 対照的辞書から類似キャプションを検索し、上位語をフィルタリングすることで、未対応画像に対して疑似BoWキャプションを生成する。
- 実際の画像-キャプションペアと疑似ラベル付き未対応画像を組み合わせた半対応データセット上で最終的な視覚言語モデルを訓練する。
- 事前学習中に画像とテキストの埋め込みの間で対照的損失を適用し、モダリティを整列させる。これはCLIPと同様の手法である。
実験結果
リサーチクエスチョン
- RQ1構文的構造を失ったBag-of-Words(BoW)キャプションは、ゼロショット視覚認識モデルの訓練に有効な教師信号として機能するか?
- RQ2BoWキャプションに語の頻度バランスを適用することで、アンバランスなBoWまたは完全キャプションと比較してゼロショット性能が向上するか?
- RQ3BoWキャプションで学習したモデルは、完全キャプションで学習したモデルと同等のゼロショット画像分類性能を達成できるか?
- RQ4類似度検索とBoWフィルタリングを用いた疑似BoWキャプション生成により、未対応画像をどれだけ活用できるか?
- RQ5テキストエンコーダーのアーキテクチャは、語のシャッフルのような入力変形に対して、どれほど不変性を示すか?
主な発見
- 完全なキャプションの代わりにBoWキャプションを用いた学習でも、ゼロショット性能に差はなく、ImageNet-1kでトップ1正答率30.1%を達成。完全キャプションでは29.5%であった。
- BoWキャプションに語の頻度バランスを適用することで、ゼロショット正答率が30.1%に向上し、アンバランスなBoWおよび完全キャプションを上回った。
- BoW教師信号を用いて300万枚の画像-キャプションペアでのみ学習したモデルが、ImageNet-1kのゼロショットで31.5%のトップ1正答率を達成。これは1500万ペアで学習したCLIP(31.3%)と同等の性能であった。
- 最近接検索とBoWフィルタリングを用いた未対応画像の疑似キャプション生成により性能が向上し、半対応学習の有効性が示された。
- 自己教師的事前学習(BYOLとBERT)を用いることで、語のシャッフルのような言語的変形に対してもモデルが頑健であることが確認された。
- 有望な向上が得られたが、一部の設定では半対応学習による改善が限定的であったため、完全教師ありまたは半教師あり学習と比較して依然として挑戦的な設定であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。