Skip to main content
QUICK REVIEW

[論文レビュー] Long-Tailed Recognition by Mutual Information Maximization between Latent Features and Ground-Truth Labels

Min-Kook Suh, Seung‐Woo Seo|arXiv (Cornell University)|May 2, 2023
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本論文は、長尾認識の課題に対処するため、潜在的特徴量と正解ラベルの相互情報量を最大化する新しい損失関数、Gaussian Mixture Likelihood (GML) を提案する。クラスごとのキューと教師-生徒フレームワークを用いてカーネル密度推定によりクラス条件付き尤度をモデル化することで、対照的学習とログティ調整を滑らかに統合し、ImageNet-LT、iNaturalist 2018、CIFAR-LT、ADE20Kのセマンティックセグメンテーションベンチマークで最先端の性能を達成する。

ABSTRACT

Although contrastive learning methods have shown prevailing performance on a variety of representation learning tasks, they encounter difficulty when the training dataset is long-tailed. Many researchers have combined contrastive learning and a logit adjustment technique to address this problem, but the combinations are done ad-hoc and a theoretical background has not yet been provided. The goal of this paper is to provide the background and further improve the performance. First, we show that the fundamental reason contrastive learning methods struggle with long-tailed tasks is that they try to maximize the mutual information maximization between latent features and input data. As ground-truth labels are not considered in the maximization, they are not able to address imbalances between class labels. Rather, we interpret the long-tailed recognition task as a mutual information maximization between latent features and ground-truth labels. This approach integrates contrastive learning and logit adjustment seamlessly to derive a loss function that shows state-of-the-art performance on long-tailed recognition benchmarks. It also demonstrates its efficacy in image segmentation tasks, verifying its versatility beyond image classification.

研究の動機と目的

  • クラス頻度の不均衡によって対照的学習が長尾データセットで性能を発揮できない理由を解明する。
  • 従来の手法が欠いていた、対照的学習とログティ調整を統合する理論的基盤を提供する。
  • 潜在的特徴量と正解ラベルの相互情報量を最大化することで、対照的学習とログティ調整を統合する包括的なフレームワークを構築する。
  • 画像分類にとどまらず、ラベル分布が不均衡なセマンティックセグメンテーションなど、他のタスクに対しても本手法の有効性を検証する。
  • 低頻度のテイルクラスでさえも効率的かつスケーラブルにガウス混合尤度をモデル化する手法を設計する。

提案手法

  • 入力データと特徴量の間の相互情報量最大化からではなく、潜在的特徴量と正解ラベルの間の相互情報量最大化として、長尾認識を再定式化する。
  • クラス頻度に基づくログティ調整の事前分布項と、ガウスカーネル密度推定で推定される尤度項から成る一般化損失関数GMLを導出する。
  • 対照的サンプルを格納するための単一のキューではなく、複数のクラス別キューを用いることで、テイルクラスの表現学習を向上させる。
  • 事前学習済みの教師ネットワークが、最新で高品質な対照的サンプルを生成する教師-生徒蒸留戦略を実装する。
  • ログティのスケーリングを適応的に行うための学習可能な温度パrameter τg を導入し、最適化の安定性と性能を向上させる。
  • 標準的な交差エントロピー損失に置き換えることで、最小限のアーキテクチャ変更で画像分類およびセマンティックセグメンテーションタスクにGML損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1対照的学習は、バランスの取れたデータでは成功しているが、なぜ長尾データセットでは失敗するのか?
  • RQ2対照的学習とログティ調整の組み合わせは、経験的なチューニングではなく、理論的に正当化できるか?
  • RQ3不均衡な設定下で、特徴量とラベルの間の相互情報量最大化を効果的に最適化する方法は何か?
  • RQ4提案手法は、画像分類にとどまらず、長尾ラベル分布を持つセマンティックセグメンテーションなどの他のタスクにも一般化可能か?
  • RQ5クラス別キューと教師-生徒フレームワークを用いたカーネル密度推定によるクラス条件付き尤度のモデル化が、どのような影響を与えるか?

主な発見

  • 提案されたGML損失は、ImageNet-LTで最先端の性能を達成し、トップ1およびトップ5精度の両面で顕著に優れた結果を示した。
  • iNaturalist 2018では85.1%のトップ1精度を達成し、従来のSOTA手法を2ポイント以上上回った。
  • CIFAR-LTでは74.8%のトップ1精度を達成し、異なる長尾ベンチマークにわたる強力な一般化性能を示した。
  • ADE20Kにおけるセマンティックセグメンテーションでは、mIoUが交差エントロピーの36.1から38.1に、mAccが45.4から51.4に向上し、優れた転送性を示した。
  • ログティ調整の最適ハイパーパrameter α は、mIoUでは α=0.2 で最良、mAccでは α=1.0 で最良を示し、ヘッドクラスとテイルクラスの性能のトレードオフを確認した。
  • 温度τgの学習により、ADE20KでmAccが58.2から58.3にわずかだが一貫した向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。