Skip to main content
QUICK REVIEW

[論文レビュー] T-MARS: Improving Visual Representations by Circumventing Text Feature Learning

Pratyush Maini, Sachin Goyal|arXiv (Cornell University)|Jul 6, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

T-MARSは、テキストが視覚的特徴を支配する画像・キャプションペアを特定し、削除することで視覚的表現学習を向上させる、新しいデータフィルタリング手法を提案する。テキストマスキングとCLIP類似度の再スコアリングを用いる。SOTAの性能を達成し、DataCompベンチマークにおいてImageNetのゼロショット精度で先行手法を6.5%上回り、データスケールに伴い線形的な精度向上を示す。

ABSTRACT

Large web-sourced multimodal datasets have powered a slew of new methods for learning general-purpose visual representations, advancing the state of the art in computer vision and revolutionizing zero- and few-shot recognition. One crucial decision facing practitioners is how, if at all, to curate these ever-larger datasets. For example, the creators of the LAION-5B dataset chose to retain only image-caption pairs whose CLIP similarity score exceeded a designated threshold. In this paper, we propose a new state-of-the-art data filtering approach motivated by our observation that nearly 40% of LAION's images contain text that overlaps significantly with the caption. Intuitively, such data could be wasteful as it incentivizes models to perform optical character recognition rather than learning visual features. However, naively removing all such data could also be wasteful, as it throws away images that contain visual features (in addition to overlapping text). Our simple and scalable approach, T-MARS (Text Masking and Re-Scoring), filters out only those pairs where the text dominates the remaining visual features -- by first masking out the text and then filtering out those with a low CLIP similarity score of the masked image. Experimentally, T-MARS outperforms the top-ranked method on the "medium scale" of DataComp (a data filtering benchmark) by a margin of 6.5% on ImageNet and 4.7% on VTAB. Additionally, our systematic evaluation on various data pool sizes from 2M to 64M shows that the accuracy gains enjoyed by T-MARS linearly increase as data and compute are scaled exponentially. Code is available at https://github.com/locuslab/T-MARS.

研究の動機と目的

  • ウェブ規模の視覚言語データセットにおけるテキスト支配画像の問題に対処し、視覚的特徴学習よりも光学的文字認識(OCR)を促進する要因を軽減すること。
  • 視覚的に豊かな画像を保持しつつ、テキスト特徴が支配する画像をフィルタリングする、スケーラブルで効果的なデータキュレーション手法の開発。
  • ターゲットフィルタリングによるデータ品質の向上を通じて、ゼロショットおよびフェイシュットの視覚性能を向上させること。
  • 特にスケールが大きい場合に、より多くのデータを追加するのではなく、『悪い』例(テキストのみの画像)を削除することが、はるかに有益であることを示すこと。

提案手法

  • T-MARSは事前学習済みOCRモデルを用いて、画像内のすべてのテキストをマスキングし、視覚的特徴を分離する。
  • その後、マスキングされた画像とその対応するキャプション間のCLIP埋め込み類似度を計算する。
  • マスキング後、類似度スコアが低いペアはフィルタリング対象となり、テキストが一致の主な信号であったことを示す。
  • 事前計算済みのCLIP特徴を活用することで、10億規模のデータセットに対してもスケーラブルかつ効率的に動作する。
  • 完全な再トレーニングを避けるために、マスキング画像とキャプションの類似度にしきい値ベースのフィルタリング戦略を採用する。
  • DataCompおよびImageNetを含む複数のベンチマークで、200万から6400万件のデータプールサイズを対象に評価が行われた。

実験結果

リサーチクエスチョン

  • RQ1テキストが視覚的特徴を支配する画像・キャプションペアをフィルタリングすることで、より良い視覚的表現学習が達成されるか?
  • RQ2シンプルなマスキングと再スコアリングアプローチが、スケール上で既存のデータフィルタリングベースラインを上回るか?
  • RQ3データ量と計算リソースの増加に伴い、データフィルタリングによる精度向上はどのようにスケーリングするか?
  • RQ4視覚のみ、テキストのみ、または視覚+テキストの異なるデータタイプの相対的有用性は、下流の視覚性能にどのように影響するか?
  • RQ5低品質(テキスト支配)の例を削除することは、高品質な新規例を追加するのよりもはるかに有益か?

主な発見

  • T-MARSは、DataCompベンチマークの『ミディアムスケール』において、ImageNetのゼロショット精度でトップランク手法を6.5%上回り、VTABでも4.7%上回った。
  • 200万から6400万件のデータプールサイズの範囲で、T-MARSはデータ量と計算リソースの指数的増加に伴い、精度向上が線形に増加した。
  • T-MARSによるフィルタリングにより、計算量の50%、トレーニングサンプル数の半分でさえ、CLIPスコアでフィルタリングされたデータセットで学習したモデルを上回る性能を達成した。
  • テキスト特徴のみの画像は負の有用性(U = -0.89)を示し、誤ラベルデータと同等であり、下流の性能を損なう。
  • 視覚的特徴とテキスト特徴の両方を持つ画像は、視覚的特徴のみの画像とほぼ同等の正の有用性(U ≈ +0.23 〜 +0.27)を示し、保持の正当性が裏付けられた。
  • 悪い例(テキストのみの画像)を pruning することは、新しい良い例を追加するのよりも3倍以上の有用性向上をもたらし、データ品質の重要性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。