Skip to main content
QUICK REVIEW

[論文レビュー] Improving Transformation Invariance in Contrastive Representation Learning

Adam Foster, Rattana Pukdee|arXiv (Cornell University)|Oct 19, 2020
Domain Adaptation and Few-Shot Learning参考文献 45被引用数 9
ひとこと要約

本稿では、対照的表現学習における変換不変性を明示的に強制する勾配に基づく正則化項を提案し、ロバストネスと下流タスクの性能を向上させている。さらに、複数の変換済み入力を用いたテスト時特徴量平均化を導入し、CIFAR-10/100および新しいSpirographデータセットで最先端の結果を達成した。これは、分布シフト下での不変性と一般化性能の向上に寄与している。

ABSTRACT

We propose methods to strengthen the invariance properties of representations obtained by contrastive learning. While existing approaches implicitly induce a degree of invariance as representations are learned, we look to more directly enforce invariance in the encoding process. To this end, we first introduce a training objective for contrastive learning that uses a novel regularizer to control how the representation changes under transformation. We show that representations trained with this objective perform better on downstream tasks and are more robust to the introduction of nuisance transformations at test time. Second, we propose a change to how test time representations are generated by introducing a feature averaging approach that combines encodings from multiple transformations of the original input, finding that this leads to across the board performance gains. Finally, we introduce the novel Spirograph dataset to explore our ideas in the context of a differentiable generative process with multiple downstream tasks, showing that our techniques for learning invariance are highly beneficial.

研究の動機と目的

  • 訓練中に不変性を明示的に強制することで、対照的表現学習における変換不変性を向上させること。
  • 従来のテスト時表現が非変換入力に依存し、マルチビュー情報の統合に失敗するという限界を是正すること。
  • 余分な変換を除外しながらも意味的情報を保持する手法を開発し、ロバストネスと一般化性能を向上させること。
  • 新しい微分可能生成データセット(Spirograph)も含む多様なベンチマークで、本手法の有効性を検証し、不変性と下流タスク性能を評価すること。
  • 訓練時とテスト時の分布シフト下でも性能が向上することを示し、学習済み表現から変換パラメータの再構築が困難になることを示すこと。

提案手法

  • 連続的変換に対してエンコーダ出力の変化が遅くなるよう制約を課す、新しい勾配正則化項を対照的損失に導入し、不変性を促進する。
  • 微分可能変換プロセスを用いて、制御可能なノイズ要因を有するデータを生成し、不変性の精密な分析を可能にする。
  • 同じ入力の複数の変換ビューをエンコードし、その特徴量を平均化することで、テスト時特徴量平均化を提案する。
  • 標準的な対照的学習目的に勾配正則化項を追加しながらも、コアの対照的損失は変更しない形でエンコーダを訓練する。
  • 線形評価プロトコルと生成パラメータの回帰を用いて、不変性と下流タスクの有用性を測定する。
  • 複数の制御可能な要因を有する完全に微分可能な生成プロセスとしてSpirographデータセットを設計し、不変性の制御された研究を可能にする。

実験結果

リサーチクエスチョン

  • RQ1データオーグメンテーションによる暗黙の不変性を超えて、明示的な勾配正則化が対照的表現の不変性を向上させられるか?
  • RQ2通常の非変換入力による推論と比較して、テスト時特徴量平均化はよりロバストかつ不変な表現をもたらすか?
  • RQ3余分な変換が訓練分布とは異なるテスト時分布シフト下でも、提案手法はどのように性能を発揮するか?
  • RQ4学習済み表現が変換パラメータをどれほど再構築しにくくできるか、すなわちより強い不変性を示すか?
  • RQ5提案手法は、複雑な微分可能生成プロセスと複数の下流タスクに一般化可能か?

主な発見

  • 勾配正則化項により、Spirographデータセットにおける変換パラメータの再構築可能性が顕著に低下し、$f_r$ のテストMSEは0.0000232から0.0000028に低下した。
  • CIFAR-100では、テスト時カラー歪みの分散スケーリングを変えて全テストで、正則化付きモデルが標準的な対照的学習を上回り、ロバストネスが向上した。
  • テスト時特徴量平均化は、すべての下流タスクおよびデータセットで一貫した性能向上をもたらし、線形評価精度の向上について理論的・実験的根拠を有する。
  • Spirographデータセットでは、勾配正則化によりすべての生成パラメータのテストMSEが低下した:$m$ は0.0006773から0.0005073に、$b$ は0.0112480から0.0073607に、$\sigma$ は0.0000914から0.0000527に、$f_r$ は0.0000232から0.0000028に低下した。
  • Spirographにおける平均シフトおよび分散増加の分布シフト下でも、提案手法は優れた性能を維持し、テスト時分布シフトに対するロバストネスを示した。
  • 訓練時における勾配正則化とテスト時の特徴量平均化の組み合わせにより、標準ベンチマークで最先端の性能を達成し、微分可能生成設定でも効果的な表現学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。