Skip to main content
QUICK REVIEW

[論文レビュー] LCReg: Long-Tailed Image Classification with Latent Categories based Recognition

Weide Liu, Zhonghua Wu|arXiv (Cornell University)|Sep 13, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

LCRegは、ヘッドクラスとテイルクラスの両方に共通するクラスに依存しない潜在特徴を学習することで、長尾画像分類を改善し、潜在空間における意味的データ拡張を可能にし、特徴の多様性と表現力を向上させます。本手法は、5つの長尾ベンチマークで最先端の性能を達成し、既存のベースラインを顕著に上回ります。

ABSTRACT

In this work, we tackle the challenging problem of long-tailed image recognition. Previous long-tailed recognition approaches mainly focus on data augmentation or re-balancing strategies for the tail classes to give them more attention during model training. However, these methods are limited by the small number of training images for the tail classes, which results in poor feature representations. To address this issue, we propose the Latent Categories based long-tail Recognition (LCReg) method. Our hypothesis is that common latent features shared by head and tail classes can be used to improve feature representation. Specifically, we learn a set of class-agnostic latent features shared by both head and tail classes, and then use semantic data augmentation on the latent features to implicitly increase the diversity of the training sample. We conduct extensive experiments on five long-tailed image recognition datasets, and the results show that our proposed method significantly improves the baselines.

研究の動機と目的

  • 限定的な訓練サンプルのため、長尾画像認識におけるテイルクラスの特徴表現が劣化する問題に対処する。
  • 従来のデータ拡張や再バランス戦略では、テイルクラスの特徴多様性を向上させられないという限界を克服する。
  • ヘッドクラスとテイルクラスの間で共通する構造的および意味的類似性(例:動物の脚)を活用して一般化性能を向上させる。
  • クラスに依存しない堅牢な潜在特徴空間を構築し、クラスの不均衡に依存しない効果的なデータ拡張を可能にする。
  • 潜在空間における意味的拡張と再構成損失を活用して、長尾データセットにおけるモデルの一般化性能と性能を向上させる

提案手法

  • すべてのクラスに共通するオブジェクトパーツ(例:脚、頭部)を捉えるクラスに依存しない潜在特徴プールを導入し、バックプロパゲーションにより学習する。
  • 類似度重み付きの和を用いて元の画像特徴を再構成し、意味のある表現を保証する再構成損失を導入する。
  • 多変量正規分布から抽出されたクラスごとの摂動を用いて、潜在特徴に対する意味的データ拡張を実施する。
  • 交差エントロピー損失、再構成損失、潜在拡張損失を組み合わせた重み付き損失関数を用い、特徴学習と一般化を同時に最適化する。
  • 共有オブジェクトパーツから導かれる意味的方向に従って潜在特徴を変換することで、潜在空間における拡張を実現し、元の画像データに依存せずに多様性を向上させる。
  • バランスの取れた潜在空間を用いてエンドツーエンドでモデルを学習し、特徴学習をクラス固有のデータ不足とは分離する

実験結果

リサーチクエスチョン

  • RQ1ヘッドクラスとテイルクラスの間で共有される潜在特徴は、長尾画像分類における表現学習を改善できるか?
  • RQ2元の画像空間ではなく、潜在空間で特徴を拡張することで、不均衡データセットにおける性能が向上するか?
  • RQ3クラスに依存しない潜在特徴の使用は、長尾データに対するモデルの一般化性能とロバスト性にどのように影響するか?
  • RQ4潜在空間における意味的データ拡張は、従来のデータ拡張および再バランス手法をどの程度上回るか?
  • RQ5損失重み付けおよび潜在特徴次元のハイパーパramータ選択に、本手法はどの程度感度を示すか?

主な発見

  • LCRegは、5つの長尾ベンチマークで最先端のトップ1正答率を達成した:CIFAR-10-LT(不均衡比100のとき91.0%)、CIFAR-100-LT(100のとき64.1%)、ImageNet-LT、iNaturalist 2018、Places-LT。
  • CIFAR-10-LTではベースライン正答率を最大3.0%向上させ、CIFAR-100-LTでは4.0%向上させ、既存手法に顕著な向上を示した。
  • 潜在特徴拡張($L_{Aug}$)は、元の特徴に直接ISDAを適用する手法よりも優れており、CIFAR-10-LT(不均衡比100)で82.5% vs. 79.8%を記録した。
  • ハイパーパramータの選択に対して本手法は頑健であり、$eta$, $eta$, $eta$ の異なる値に対しても性能低下が最小限に抑えられており、安定的かつ柔軟な最適化が可能であることが示された。
  • KLダイバージェンス解析により、潜在特徴がクラス間で意味的で共通する構造を捉えていることが確認され、ヘッドクラスとテイルクラスの表現間でダイバージェンスが低かった。
  • アブレーションスタディの結果、再構成損失と潜在拡張が併用されることで性能が向上し、すべてのモジュールを組み合わせた際が最も良い結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。