Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Generative-Contrastive Representation Learning

Saehoon Kim, Sungwoong Kim|arXiv (Cornell University)|Jun 11, 2021
Domain Adaptation and Few-Shot Learning参考文献 51被引用数 5
ひとこと要約

本論文は、1つのトランスフォーマー基盤のエンコーダ・デコーダアーキテクチャに統合された、対照的および生成的目的を同時に最適化するハイブリッドフレームワーク、生成的対照的表現学習(GCRL)を提案する。エンコーダのプールドされた [CLS]-トークン特徴量にインスタンスごとの対照的損失を適用し、デコーダ出力に自己回帰的尤度損失を適用することで、GCRLは分類性能と分布シフトに対するロバストネスの両面で優れた性能を達成し、画像分類およびOOD検出タスクにおいて、純粋な対照的学習および生成的事前学習の両方を上回る。

ABSTRACT

Unsupervised representation learning has recently received lots of interest due to its powerful generalizability through effectively leveraging large-scale unlabeled data. There are two prevalent approaches for this, contrastive learning and generative pre-training, where the former learns representations from instance-wise discrimination tasks and the latter learns them from estimating the likelihood. These seemingly orthogonal approaches have their own strengths and weaknesses. Contrastive learning tends to extract semantic information and discards details irrelevant for classifying objects, making the representations effective for discriminative tasks while degrading robustness to out-of-distribution data. On the other hand, the generative pre-training directly estimates the data distribution, so the representations tend to be robust but not optimal for discriminative tasks. In this paper, we show that we could achieve the best of both worlds by a hybrid training scheme. Specifically, we demonstrated that a transformer-based encoder-decoder architecture trained with both contrastive and generative losses can learn highly discriminative and robust representations without hurting the generative performance. We extensively validate our approach on various tasks.

研究の動機と目的

  • 教師なし表現学習における識別力とロバストネスのトレードオフを解消すること。
  • 標準的な事前学習フレームワークにおける対照的および生成的目的の不適合性を克服すること。
  • 低データおよび分布外(OOD)設定における一般化性能と不確実性キャリブレーションの向上を図ること。
  • 下流分類精度を向上させる一方で、強力な生成性能を維持すること。
  • 特別なモジュールやインダクティブバイアスを用いずに、統一的かつパラメータ効率の良い学習スキームを実現すること。

提案手法

  • 標準的なトランスフォーマーブロックをエンコーダ・デコーダ構造として再解釈し、表現学習の役割を分離する。
  • エンコーダの[CLS]-トークン特徴量に、インスタンス識別を目的とした対照的損失を適用する。
  • デコーダ出力に自己回帰的尤度損失を適用し、入力画像の再構成を実現する。
  • 2段階の訓練スキームを採用:最初に生成的損失のみで学習(100エポック)、その後両方の損失を併用(100エポック)。
  • 公平な比較のため、SimCLRと同一の標準的なデータ拡張(例:ランダムクロップ、反転)を採用する。
  • 追加のアーキテクチャ的変更を避ける一方で、トランスフォーマーのインダクティブバイアスを活用する。

実験結果

リサーチクエスチョン

  • RQ1対照的および生成的目的を、1つの教師なし表現学習フレームワークに効果的に統合できるか?
  • RQ2二重目的の最適化は、単一目的の事前学習に比べて、下流分類精度を向上させるか?
  • RQ3ハイブリッドアプローチは、分布シフトに対するロバストネスと不確実性キャリブレーションを向上させるか?
  • RQ4生成的目的の追加により、弱い拡張条件下での対照的学習における過学習が抑制されるか?
  • RQ5優れた識別的特徴を達成しつつ、強力な生成性能を維持できるか?

主な発見

  • 線形評価において、GCRLはCIFAR-10で94.12%、CIFAR-100で74.03%の精度を達成し、ResNet-18(93.60%)およびiGPT(89.79%および67.09%)を上回った。
  • CIFAR-10では期待キャリブレーション誤差(ECE)を0.0337にまで低下させ、iGPTおよびResNetより優れた不確実性キャリブレーションを示した。
  • OOD検出において、GCRLはSimCLRおよびiGPTを上回る高いAUROCおよびAUPRスコアを達成し、ロバストネスの向上を示した。
  • アブレーションスタディでは、弱い拡張条件下でもGCRLが生成性能を維持しながら、過学習を抑制しており、安定したテスト損失と低いECEが観察された。
  • 容易な事前学習タスク(例:80%クロップ比)でさえも、GCRLは過学習を防ぎ、SimCLRと比較して400エポック以降に損失が上昇するのを回避した。
  • アーキテクチャ的変更や特別なコンponentsを用いずに、線形評価およびOOD検出で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。