Skip to main content
QUICK REVIEW

[論文レビュー] Temperature as Uncertainty in Contrastive Learning

Oliver Zhang, Mike Wu|arXiv (Cornell University)|Oct 8, 2021
Domain Adaptation and Few-Shot Learning参考文献 42被引用数 9
ひとこと要約

本稿では、埋め込みの信頼性の度合いを学習可能な測度として温度ハイパーパrameterを再解釈することで、入力に依存する不確実性スコアを生成する方法であるTemperature as Uncertainty (TaU)を提案する。温度を入力ごとに変化させることで、下流タスクにおける性能低下を最小限に抑えつつ、分布外検出を可能にし、再訓練を必要とせず事前学習済みモデルに対しても後から適用可能である。

ABSTRACT

Contrastive learning has demonstrated great capability to learn representations without annotations, even outperforming supervised baselines. However, it still lacks important properties useful for real-world application, one of which is uncertainty. In this paper, we propose a simple way to generate uncertainty scores for many contrastive methods by re-purposing temperature, a mysterious hyperparameter used for scaling. By observing that temperature controls how sensitive the objective is to specific embedding locations, we aim to learn temperature as an input-dependent variable, treating it as a measure of embedding confidence. We call this approach "Temperature as Uncertainty", or TaU. Through experiments, we demonstrate that TaU is useful for out-of-distribution detection, while remaining competitive with benchmarks on linear evaluation. Moreover, we show that TaU can be learned on top of pretrained models, enabling uncertainty scores to be generated post-hoc with popular off-the-shelf models. In summary, TaU is a simple yet versatile method for generating uncertainties for contrastive learning. Open source code can be found at: https://github.com/mhw32/temperature-as-uncertainty-public.

研究の動機と目的

  • 安全上の重要な応用分野における実用化を制限する、対照的表現学習における不確実性推定の欠如に対処すること。
  • 一般的に固定スカラーと見なされる温度ハイパーパrameterが、学習された入力固有の不確実性の測度として再利用可能かどうかを検討すること。
  • 主なエンコーダーを再訓練することなく、不確実性推定を可能にするため、既存の市販のチェックポイントに対しても後から適用可能であることを実現すること。
  • TaUが標準的な下流ベンチマークで競争力ある性能を維持しつつ、分布外検出性能を向上させるかどうかを評価すること。

提案手法

  • 対照的学習における温度ハイパーパrameter τ を、入力ごとに変化する変数に再利用し、各入力 x に対して τ(x) を出力するニューラルネットワークヘッドによって学習する。
  • 対照的損失(例:SimCLR や MoCo-v2)を、固定された τ の代わりに τ(t(x_i)) を使用するように変更する。ここで t(x_i) は入力 x_i の変換されたビューを表す。
  • エンコーダー・ネットワークを、埋め込み f(x) と逆温度 τ(x) の両方を出力するように訓練し、τ(x) は正の値を保証するためシグモイドスケールのヘッドによって予測する。
  • 逆温度 τ(x) を不確実性の代理として使用する:τ が大きいほど不確実性が高く(損失がゆるやか)、τ が小さいほど信頼性が高い。
  • 事前学習済みモデルに TaU を適用する際は、固定された特徴量の上に小さなアダプターヘッドを微調整して τ(x) を予測することで、後から不確実性推定を可能にする。
  • 予測された τ(x) を用いて不確実性を反映した類似度スコアを計算し、ベンチマークデータセット上で AUROC を用いて分布外検出性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1対照的学習における温度ハイパーパrameterが、学習された入力依存の不確実性測度として再解釈可能か?
  • RQ2入力ごとに温度を学習することで、固定温度ベースラインと比較して分布外検出性能が向上するか?
  • RQ3主なエンコーダーを再訓練することなく、事前学習済み対照的モデルに不確実性を後から追加できるか?
  • RQ4標準的な対照的モデル(固定温度)と比較して、TaU は下流の線形評価精度でどの程度の性能を示すか?
  • RQ5TaU は、学習分布から意味的に離れた OOD データに対して、多様な OOD データセットで一般化できるか?

主な発見

  • TaU は、SVHN など距離の遠い OOD セットにおいて、アンサンブルやベイジアン後確率に基づくベースラインを上回り、AUROC で最大 13% の上昇を示した。
  • CIFAR100 および TinyImageNet では、SimCLR + kNN を含むすべてのベースラインと同等またはわずかに優れた性能を示し、0.5–2% の性能ギャップを示した。
  • 標準的な SimCLR や MoCo-v2 と比較して、線形評価精度がわずか 2–3 パcent 点低下するにとどまり、下流タスクへの影響が最小限であることが示された。
  • 事前学習済みモデル(例:教師あり学習、SimCLR、BYOL、CLIP)に対し、後から TaU を適用でき、CIFAR10(AUROC 0.913)および SVHN(AUROC 0.978)で高い AUROC を達成した(教師ありまたは SimCLR 特徴量を使用)。
  • CLIP の埋め込みでは、TaU による分布外検出が不十分であった(AUROC ~0.05)が、これはモデル固有の制限や分布の不一致を示唆しており、COCO や LSUN では良好な性能を示した。
  • 勾配停止を用いて負例を置き換える対照的フレームワーク(例:SimSiam や BYOL)では、本手法が効果を発揮しないことが判明し、NCEに基づく目的関数に限定されることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。