Skip to main content
QUICK REVIEW

[論文レビュー] Center-wise Local Image Mixture For Contrastive Representation Learning

Hao Li, Xiaopeng Zhang|arXiv (Cornell University)|Nov 5, 2020
Domain Adaptation and Few-Shot Learning参考文献 33被引用数 4
ひとこと要約

本論文は、クラスタ中心に基づくローカル画像ミキシングを用いて意味的に類似した陽性サンプルを選択することで、特徴の一般化を向上させる対照的表現学習手法CLIMを提案する。クラスタ中心を用いた陽性サンプル選択と、CutMixに基づくデータミキシング、マルチリゾリューション増強を組み合わせることで、ResNet-50を用いたImageNet線形評価で75.5%のトップ1精度を達成し、200エポックでの訓練のみでMoCoを4.8%上回った。

ABSTRACT

Contrastive learning based on instance discrimination trains model to discriminate different transformations of the anchor sample from other samples, which does not consider the semantic similarity among samples. This paper proposes a new kind of contrastive learning method, named CLIM, which uses positives from other samples in the dataset. This is achieved by searching local similar samples of the anchor, and selecting samples that are closer to the corresponding cluster center, which we denote as center-wise local image selection. The selected samples are instantiated via an data mixture strategy, which performs as a smoothing regularization. As a result, CLIM encourages both local similarity and global aggregation in a robust way, which we find is beneficial for feature representation. Besides, we introduce \emph{multi-resolution} augmentation, which enables the representation to be scale invariant. We reach 75.5% top-1 accuracy with linear evaluation over ResNet-50, and 59.3% top-1 accuracy when fine-tuned with only 1% labels.

研究の動機と目的

  • 対照的学習におけるインスタンス同定の限界、すなわちサンプル間の意味的類似性を無視することを是正すること。
  • 自己教師付き学習において、局所的類似性とグローバルクラスタ構造の両方を組み込むことで、特徴表現を向上させること。
  • 弱教師付き対照的学習におけるノイズの多い陽性サンプルの影響を、頑健なデータミキシング正則化によって軽減すること。
  • マルチリゾリューションデータ増強を用いて、表現におけるスケール不変性を明示的にモデル化すること。
  • 特に低ショット微調整設定において、最小限のラベルデータで最先端の性能を達成すること。

提案手法

  • アーキテクチャの中心に基づくローカル画像選択を提案:各アーキテクチャ画像に対して、k個の近隣を特定し、それらのうち対応するクラスタ中心に近いもののみを陽性サンプルとして選択する。
  • 対照的損失を正則化するためのデータミキシング戦略(CutMix風)を導入し、予測を滑らかにし、ノイズの多い陽性サンプルに対する過信を低減する。
  • 同じ画像のパッチを異なる解像度(例:224×224と160×160)で対比することでマルチリゾリューション増強を実装し、スケール不変性を明示的にモデル化する。
  • K-meansクラスタリングを用いてクラスタ中心を定義し、意味的に関連する陽性サンプルの選択をガイドする。
  • 混合表現に対して標準的な対照的損失(例:MoCo風)を適用し、局所的類似性とグローバルクラスタ構造の両方の利点を統合する。
  • 標準的なデータ増強(クロップ、カラーじゅつ、など)と併用して、標準的な自己教師付き学習を用いてモデルをエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1クラスタ中心への近接性に基づく陽性サンプル選択が、インスタンス同定を超えて表現学習を向上させるか?
  • RQ2陽性サンプルにノイズが含まれる場合、CutMixによるデータミキシングが対照的学習を効果的に正則化するか?
  • RQ3明示的なマルチリゾリューション対比学習が、自己教師付き表現学習におけるスケール不変性と性能向上に寄与するか?
  • RQ4CLIMは特に1%のラベルデータでの低データ微調整設定でどのように性能を発揮するか?
  • RQ5中心に基づく選択、データミキシング、マルチリゾリューション増強の組み合わせが、ベンチマーク全体で一貫した向上をもたらすか?

主な発見

  • CLIMは、ResNet-50を用いたImageNet線形評価で75.5%のトップ1精度を達成し、200エポックでの訓練のみでMoCo v2を4.8%上回った。
  • 1%のラベルデータでの微調整において、CLIMは59.3%のトップ1精度を達成し、下流タスクにおける完全教師ありベースラインを上回った。
  • クラスタ中心に基づく陽性サンプル選択は、KNN+K-means選択よりも1.3%、標準的なMoCo v2よりも1.8%の性能向上をもたらした。
  • CutMixに基づくデータミキシングは、すべての選択戦略において一貫して精度を向上させ、ノイズの多い陽性サンプルを用いた場合に最大で1.8%の向上をもたらした。
  • 224×224と160×160のクロップを用いたマルチリゾリューション増強では72.3%の精度を達成し、マルチクロップベースライン(69.7%)とMoCo(800エポック、71.1%)を大きく上回った。
  • アブレーションスタディにより、中心に基づく選択、CutMix、マルチリゾリューション増強の組み合わせが最も高い性能を発揮することが確認され、各コンポonentが段階的に寄与していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。