Skip to main content
QUICK REVIEW

[論文レビュー] Temperature Schedules for Self-Supervised Contrastive Methods on Long-Tail Data

Anna Kukleva, Moritz Böhle|arXiv (Cornell University)|Mar 23, 2023
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

本論文では、長尾データにおける自己教師付き対照的学習に向けた動的温度スケジューリングを提案する。訓練中にコサイン減衰を用いて高温と低温の温度値を交互に切り替えることで、インスタンスレベルとグループレベルの識別を切り替える。この方法により、追加の計算コストをかけずに、ヘッドクラスとテールクラスの両方の表現品質が向上し、複数のデータセットおよび不均衡比において、固定温度ベースラインを一貫して上回る性能を発揮する。

ABSTRACT

Most approaches for self-supervised learning (SSL) are optimised on curated balanced datasets, e.g. ImageNet, despite the fact that natural data usually exhibits long-tail distributions. In this paper, we analyse the behaviour of one of the most popular variants of SSL, i.e. contrastive methods, on long-tail data. In particular, we investigate the role of the temperature parameter $τ$ in the contrastive loss, by analysing the loss through the lens of average distance maximisation, and find that a large $τ$ emphasises group-wise discrimination, whereas a small $τ$ leads to a higher degree of instance discrimination. While $τ$ has thus far been treated exclusively as a constant hyperparameter, in this work, we propose to employ a dynamic $τ$ and show that a simple cosine schedule can yield significant improvements in the learnt representations. Such a schedule results in a constant `task switching' between an emphasis on instance discrimination and group-wise discrimination and thereby ensures that the model learns both group-wise features, as well as instance-specific details. Since frequent classes benefit from the former, while infrequent classes require the latter, we find this method to consistently improve separation between the classes in long-tail data without any additional computational cost.

研究の動機と目的

  • 長尾データ分布における対照的学習における温度パラメータ τ の役割を分析すること。
  • τ が埋め込み空間におけるインスタンス識別とグループごとの識別とのバランスに与える影響を理解すること。
  • 訓練中に τ を動的にスケジューリングすることで、長尾データセットの表現学習を改善すること。
  • 識別タイプの切り替えが、レアクラスと頻度の高いクラスの両方の性能向上に寄与することを示すこと。

提案手法

  • 訓練エポックにわたって高温から低温へ変化するコサインスケジュールを温度ハイパーパrameter τ に導入する。
  • 平均距離最大化の観点から対照的損失を再定式化し、τ が埋め込み空間の構造に与える影響を解釈する。
  • 動的 τ を用いて、低 τ 時にはインスタンス固有の特徴に焦点を当て(インスタンス識別を強化)、高 τ 時には意味的グループ構造に焦点を当てる(グループ識別を強化)ように切り替える。
  • アーキテクチャの変更や追加計算を伴わず、MoCo や SimCLR などの最先端の対照的モデルにスケジュールを適用する。
  • CIFAR10-LT や ImageNet-LT などの複数のデータセットを用い、さまざまな不均衡比で評価する。
  • 固定 τ、線形振動、段階関数、τ のランダムサンプリングと比較して、動的 τ スケジュールの有効性を検証する。

実験結果

リサーチクエスチョン

  • RQ1温度パラメータ τ は、対照的学習におけるインスタンスレベルとグループワイドな識別とのバランスにどのように影響するか?
  • RQ2動的 τ スケジュールは、長尾データ分布における表現品質にどのような影響を及ぼすか?
  • RQ3高温と低温の τ 値を交互に切り替えることで、なぜレアクラスの性能が向上するのか?
  • RQ4スケジュールの選択(例:コサイン対線形対ランダム)が、下流性能に与える影響は何か?
  • RQ5提案手法は、異なるモデル、データセット、不均衡レベルに一般化可能か?

主な発見

  • τ にコサインスケジュールを適用することで、CIFAR10-LT や ImageNet-LT を含む複数のデータセットで、少数ショット線形プローブ精度が一貫して向上し、固定 τ=0.2 に対して最大 3.98 パcentage point の向上を達成した。
  • 最良の性能は、全期間の約 0.7 の時点で訓練を停止した場合に得られ、タスク切り替えの最適タイミングを示唆している。
  • 本手法はヘッドクラスとテールクラスの両方の表現品質を向上させ、特にインスタンス識別が強化されたことで、希少クラスでの向上が顕著に見られた。
  • 線形振動、段階関数、τ のランダムサンプリングといった代替スケジュールよりも、動的 τ スケジュールが優れていることから、タスク切り替えの時間的パターンが重要であることが示された。
  • ハイパーパrameterの選択やモデルアーキテクチャ(MoCo や SimCLR など)の違いに対しても、改善効果は安定しており、追加の計算コストなしに有効である。
  • 分析の結果、高 τ 時にはグループワイドな識別と密なクラスタ形成が強調され、低 τ 時にはインスタンスレベルの識別と埋め込み空間内の均一性が促進されることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。