Skip to main content
QUICK REVIEW

[論文レビュー] ResLT: Residual Learning for Long-tailed Recognition

Jiequan Cui, Shu Liu|arXiv (Cornell University)|Jan 26, 2021
Domain Adaptation and Few-Shot Learning被引用数 13
ひとこと要約

本論文は、ヘッド、ミディアム、テイルクラスの間でモデルパラメータを直接再バランス化することで、長尾画像認識のための新しい残差学習フレームワークであるResLTを提案する。三本のブランチからなる残差統合機構を導入し、メインブランチがすべてのクラスを処理し、二つの段階的に特化した残差ブランチがミディアム+テイルクラスおよびテイルクラスの認識を向上させる。CIFAR、ImageNet、Places、iNaturalistのベンチマークにおいて、従来手法を上回る一貫した性能向上を達成し、最先端の精度を実現する。

ABSTRACT

Deep learning algorithms face great challenges with long-tailed data distribution which, however, is quite a common case in real-world scenarios. Previous methods tackle the problem from either the aspect of input space (re-sampling classes with different frequencies) or loss space (re-weighting classes with different weights), suffering from heavy over-fitting to tail classes or hard optimization during training. To alleviate these issues, we propose a more fundamental perspective for long-tailed recognition, i.e., from the aspect of parameter space, and aims to preserve specific capacity for classes with low frequencies. From this perspective, the trivial solution utilizes different branches for the head, medium, and tail classes respectively, and then sums their outputs as the final results is not feasible. Instead, we design the effective residual fusion mechanism -- with one main branch optimized to recognize images from all classes, another two residual branches are gradually fused and optimized to enhance images from medium+tail classes and tail classes respectively. Then the branches are aggregated into final results by additive shortcuts. We test our method on several benchmarks, i.e., long-tailed version of CIFAR-10, CIFAR-100, Places, ImageNet, and iNaturalist 2018. Experimental results manifest the effectiveness of our method. Our code is available at https://github.com/jiequancui/ResLT.

研究の動機と目的

  • クラスの不均衡がモデル性能を著しく低下させる現実世界のデータセットにおける長尾認識問題に対処すること。
  • 過学習や最適化の困難さを引き起こす既存の入力空間(再サンプリング)および損失空間(再重み付け)手法の限界を克服すること。
  • モデルパラメータを直接再バランス化することで、低頻度クラスの専門的容量を保持する根本的に新しいアプローチを提案すること。
  • ヘッドクラスの精度を損なわず、テイルクラスの性能を向上させる効果的な残差統合メカニズムを設計すること。

提案手法

  • 三本のブランチアーキテクチャを導入:すべてのクラスで学習するメインブランチ(N_h+m+t)と、ミディアム+テイルクラスおよびテイルクラスに段階的に特化した二つの残差ブランチ(N_m+t および N_t)を設ける。
  • すべての三つのブランチの出力を加法的なショートカットで統合することで、段階的にテイルクラス認識を向上させる残差学習を可能にする。
  • トレーニング中にヘッド、ミディアム、テイルクラスがそれぞれのブランチで依然として支配的であるようにすることで、パラメータの特化を維持する。
  • 複雑な二段階トレーニングや知識蒸留を避けるために、標準的な最適化手法を用いてネットワーク全体をエンドツーエンドで学習する。
  • アーキテクチャの変更を残差統合設計を除き、標準的なCNN(例:ResNet、ResNeXt)にこのフレームワークを適用可能にする。
  • メインブランチでは標準的なクロスエントロピー損失にクラスウェイトを適用するが、残差ブランチはメインブランチの残差誤差から学習する。

実験結果

リサーチクエスチョン

  • RQ1ヘッド、ミディアム、テイルクラスの間でモデルパラメータを直接再バランス化することで、長尾認識性能が向上するか?
  • RQ2段階的にテイルクラス認識を向上させる残差統合メカニズムは、標準的な再サンプリングおよび再重み付け戦略を上回るか?
  • RQ3共有アーキテクチャにおいて、テイルクラスへの過学習を防ぎながらも、パラメータの特化を維持できるか?
  • RQ4本手法は、多様な長尾ベンチマークにおいて、最先端のワンステージおよびツオステージ手法と比較してどのように性能を発揮するか?

主な発見

  • ImageNet-LTでは、ResNeXt-50を用いたResLTが180エポックで57.6%のトップ-1精度を達成し、RIDEを1.6%上回り、SOTA手法を1.0–1.4%上回る。
  • Places-LTでは、ResLTが39.8%のトップ-1精度を達成し、以前のSOTA分離手法よりも1.9%高い。
  • iNaturalist 2018では、ResNet-152を用いたResLTが73.2%のトップ-1精度を達成し、同じトレーニングスケジュール下でSOTAを0.7%上回る。
  • 不均衡比0.01のCIFAR-100-LTでは、RIDEResNetを用いたResLTが49.73%のトップ-1精度を達成し、RIDEを上回る。
  • ResLTは最小限の推論コストを維持しており、RIDEと比較して追加で0.04G FLOPs、バッチサイズ64枚あたり17.2msの推論時間増加にとどまる。
  • アブレーションスタディにより、パラメータの特化と残差学習メカニズムの両方が性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。