Skip to main content
QUICK REVIEW

[論文レビュー] MixSiam: A Mixture-based Approach to Self-supervised Representation Learning

X. Guo, Tianhao Zhao|arXiv (Cornell University)|Nov 4, 2021
Domain Adaptation and Few-Shot Learning参考文献 51被引用数 8
ひとこと要約

MixSiamは、MixUpを用いてハードなオーグメンテーションサンプルを導入し、特徴の最大化から得られる識別的表現に対する不変性を強制することで、シモネス対照学習を向上させる混合型自己教師あり学習手法を提案する。この手法は、同じ訓練設定下でImageNetおよび小規模データセットにおいて、最先端の性能を達成し、ロバストネスと一般化性能が向上しており、SimSiamを最大0.64%の精度向上で上回っている。

ABSTRACT

Recently contrastive learning has shown significant progress in learning visual representations from unlabeled data. The core idea is training the backbone to be invariant to different augmentations of an instance. While most methods only maximize the feature similarity between two augmented data, we further generate more challenging training samples and force the model to keep predicting discriminative representation on these hard samples. In this paper, we propose MixSiam, a mixture-based approach upon the traditional siamese network. On the one hand, we input two augmented images of an instance to the backbone and obtain the discriminative representation by performing an element-wise maximum of two features. On the other hand, we take the mixture of these augmented images as input, and expect the model prediction to be close to the discriminative representation. In this way, the model could access more variant data samples of an instance and keep predicting invariant discriminative representations for them. Thus the learned model is more robust compared to previous contrastive learning methods. Extensive experiments on large-scale datasets show that MixSiam steadily improves the baseline and achieves competitive results with state-of-the-art methods. Our code will be released soon.

研究の動機と目的

  • 大規模なクラス内変動にさらされたシモネス対照学習の限界的なロバストネスを改善すること。
  • 標準的なデータオーグメンテーションを超えたハードで多様なトレーニングサンプルを導入することで、モデルの一般化性能を向上させること。
  • 同じ画像の2つのオーグメント化されたビューから得られる特徴を最大にすることで、特徴の識別性を高めること。
  • より強い不変性制約を活用することで、より小さなバッチサイズでも競争力のある性能を達成すること。

提案手法

  • 同じ画像の2つのオーグメント化されたビューを処理する共有重みを有するシモネスエンコーダ構造を採用する。
  • 2つのオーグメント化されたビューからの特徴表現を要素ごとの最大値によって結合し、最も情報の多い特徴を捉える識別的表現を形成する。
  • MixUpを用いて2つのオーグメント化されたビューを線形混合することで、モデルが予測する必要があるハードで挑戦的なサンプルを生成する。
  • 予測ヘッドは、識別的表現と類似する予測を生成するように訓練され、多様な入力に対して不変性を強制する。
  • 正例ペアの対照損失と混合サンプルの整合性損失を組み合わせた重み付き損失関数を用い、ハイパーパrameter λ が2つの損失をバランス調整する。
  • 標準的なデータオーグメンテーション(クロップ、カラーのジャマ、ぼかし、ランダムグレースケール)とMixUpを組み合わせて、多様なトレーニングサンプルを生成する。

実験結果

リサーチクエスチョン

  • RQ1MixUpによる仮想的なハードなサンプルの導入は、シモネス対照フレームワークにおける自己教師あり表現学習のロバストネスを向上させることができるか?
  • RQ2オーグメント化されたビュー間の特徴最大化と混合サンプルへの不変性を組み合わせることで、標準的な対照学習よりも優れた一般化性能が得られるか?
  • RQ3容易な正例ペアとハードな混合サンプルの間のバランスがモデル性能に与える影響は何か?最適なトレードオフは何か?
  • RQ4MixSiamは、最先端の手法と比較して、より小さなバッチサイズでも競争力ある精度を達成できるか?

主な発見

  • CIFAR-10では93.35%のトップ-1精度を達成し、SimSiamベースラインを0.64%上回った。
  • ImageNetではバッチサイズ256で81.9%のトップ-1精度を達成し、同様の訓練条件下で最先端の手法と同等またはそれを上回った。
  • アブレーションスタディの結果、特徴の最大値集約(maximum aggregation)が最良のパフォーマンスを示し、平均プーリングよりも0.64%の精度向上を達成した。
  • ハイパーパrameter λ = 0.5 が最適なトレードオフを提供し、複数のデータセットで最高の性能を発揮した。
  • 可視化の結果、混合画像は視覚的にぼやけており、重複する特徴を含んでおり、予測が困難であることが確認され、結果としてモデルのロバストネスが向上した。
  • CIFAR-10、CIFAR-100、Food101を含む複数のベンチマークで一貫した性能向上を示し、強力な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。