Skip to main content
QUICK REVIEW

[論文レビュー] Inter-Instance Similarity Modeling for Contrastive Learning

Chengchao Shen, Dawei Liu|arXiv (Cornell University)|Jun 21, 2023
Advanced Image and Video Retrieval Techniques被引用数 6
ひとこと要約

この論文では、ミニバッチ内の複数の画像からランダムにパッチを組み合わせることで、豊富なインスタンス間類似度をモデル化する、ビジョントランスフォーマー向けの新しい画像混合手法PatchMixを提案する。パッチレベルでの複数画像混合を可能にすることで、ミックス→元画像、ミックス→ミックス、元画像→元画像の類似度を活用した対照学習を強化し、ImageNet-1Kでは3.0%の線形精度向上、CIFAR100では8.7%のkNN精度向上を達成し、最先端の性能を実現した。

ABSTRACT

The existing contrastive learning methods widely adopt one-hot instance discrimination as pretext task for self-supervised learning, which inevitably neglects rich inter-instance similarities among natural images, then leading to potential representation degeneration. In this paper, we propose a novel image mix method, PatchMix, for contrastive learning in Vision Transformer (ViT), to model inter-instance similarities among images. Following the nature of ViT, we randomly mix multiple images from mini-batch in patch level to construct mixed image patch sequences for ViT. Compared to the existing sample mix methods, our PatchMix can flexibly and efficiently mix more than two images and simulate more complicated similarity relations among natural images. In this manner, our contrastive framework can significantly reduce the gap between contrastive objective and ground truth in reality. Experimental results demonstrate that our proposed method significantly outperforms the previous state-of-the-art on both ImageNet-1K and CIFAR datasets, e.g., 3.0% linear accuracy improvement on ImageNet-1K and 8.7% kNN accuracy improvement on CIFAR100. Moreover, our method achieves the leading transfer performance on downstream tasks, object detection and instance segmentation on COCO dataset. The code is available at https://github.com/visresearch/patchmix

研究の動機と目的

  • 自然画像に存在する豊富なインスタンス間類似度を無視する、1ホットエンコーディングに依存する従来の対照学習手法の限界を解消する。
  • 同じ画像からの正例ペア以外のクラス内およびクラス間類似度を捉えられない、単調な類似度目的関数の課題を克服する。
  • 複数の画像間におけるソフトで複雑な類似関係を自己教師ありの形でモデル化することで、非教師あり表現学習を向上させる。
  • 特にオブジェクト検出やインスタンスセグメンテーションのような、局所構造に敏感な下流タスクにおいて、一般化性能と転移可能性を向上させる。
  • ビジョントランスフォーマーと互換性があり、2つ以上の画像を柔軟かつ効率的に混合できるパッチレベルの混合戦略を開発する。

提案手法

  • ミニバッチ内の複数の画像からパッチ列をランダムに組み合わせてハイブリッド画像列を形成する、パッチレベルの画像混合手法PatchMixを提案する。
  • 異なるソース画像からパッチをサンプリングすることで混合画像を構築し、局所的な視覚的コンポONENT(例:犬の頭部、鳥の翼)を保持することで、現実的なインスタンス間類似度を模倣する。
  • ミックス→元画像、ミックス→ミックス、元画像→元画像の3つのストリームで構成される対照学習フレームワークを実装し、多様な類似関係をモデル化する。
  • 訓練の安定化と表現品質の向上を図るため、温度スケーリングを施した類似度メトリクスを対照目的関数に採用する。
  • ビジョントランスフォーマーが持つ固有のシーケンス構造を活用し、非連続なパッチ混合によっても長距離依存性学習を維持する。
  • 混合画像、元画像、および混合画像同士のペairからなるポジティブペアをバランスさせるジョイント対照目的関数を用いてViTモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1複数の画像間におけるより豊富なインスタンス間類似度をモデル化することで、対照学習における自己教師あり表現学習が向上するか?
  • RQ2Mixup や CutMix といった従来の2画像混合手法と比較して、PatchMixは複雑な視覚的類似度をどれほど効果的に捉えられるか?
  • RQ3PatchMixは、対照学習の目的関数と現実世界の画像類似度分布との間の分布ギャップをどの程度縮小するか?
  • RQ4オブジェクト検出やインスタンスセグメンテーションのような、細粒度の局所構造理解を要する下流タスクにおいて、PatchMixは転移性能を向上させるか?
  • RQ5追加データなしで、CIFAR10 や CIFAR100 のような小規模データセットにおいて、PatchMixは表現の退化や過学習を緩和できるか?

主な発見

  • PatchMixは、以前の最先端手法と比較して、ImageNet-1Kにおける線形評価精度で3.0%の向上を達成した。
  • CIFAR100では、kNN精度が8.7%向上し、より優れた一般化性能と表現品質を示した。
  • COCOデータセットを用いたオブジェクト検出およびインスタンスセグメンテーションタスクにおいても、最先端の性能を達成した。これは、強力な転移可能性を裏付けている。
  • より長い事前学習スケジュールで性能が向上し、800エポックで飽和に達した。これは、安定的かつスケーラブルな訓練ダイナミクスを示している。
  • 可視化の結果、DINO や SDMP と比較して、関連する画像や同じカテゴリに属する画像同士の類似度分布が著しく豊富であることが確認された。
  • PatchMixで訓練されたモデルは、特に異なる画像インスタンス間のコンponentsレベルの類似度を捉える能力に優れており、一般化性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。