[論文レビュー] Global and Local Mixture Consistency Cumulative Learning for Long-tailed Visual Recognitions
本論文は、長尾分布の視覚認識のための1段階学習フレームワークであるグローバル・ローカル混合一貫性累積学習(GLMC)を提案する。GLMCは、同じバッチ内のグローバル(MixUp)およびローカル(CutMix)な増幅の表現間の負のコサイン類似度を最小化することで特徴抽出器のロバスト性を向上させるとともに、エポックごとに蓄積されたクラス頻度に重みを付けたソフトラベルを用いて、ヘッドクラスへのバイアスを軽減する。GLMCはCIFAR10-LT、CIFAR100-LT、ImageNet-LTで最先端の精度を達成し、バランスの取れたImageNetおよびCIFARデータセットでも顕著な一般化性能向上を示した。
In this paper, our goal is to design a simple learning paradigm for long-tail visual recognition, which not only improves the robustness of the feature extractor but also alleviates the bias of the classifier towards head classes while reducing the training skills and overhead. We propose an efficient one-stage training strategy for long-tailed visual recognition called Global and Local Mixture Consistency cumulative learning (GLMC). Our core ideas are twofold: (1) a global and local mixture consistency loss improves the robustness of the feature extractor. Specifically, we generate two augmented batches by the global MixUp and local CutMix from the same batch data, respectively, and then use cosine similarity to minimize the difference. (2) A cumulative head tail soft label reweighted loss mitigates the head class bias problem. We use empirical class frequencies to reweight the mixed label of the head-tail class for long-tailed data and then balance the conventional loss and the rebalanced loss with a coefficient accumulated by epochs. Our approach achieves state-of-the-art accuracy on CIFAR10-LT, CIFAR100-LT, and ImageNet-LT datasets. Additional experiments on balanced ImageNet and CIFAR demonstrate that GLMC can significantly improve the generalization of backbones. Code is made publicly available at https://github.com/ynu-yangpeng/GLMC.
研究の動機と目的
- 長尾分布の視覚認識データセットにおけるヘッドクラスバイアスと一般化性能の低さという課題に取り組む。
- 複雑さとオーバーヘッドを伴うマルチステージ学習を回避する1段階学習パラダイムを開発する。
- 負例ペアや大バッチ学習を必要とせず、特徴抽出器のロバスト性を向上させる。
- エポック蓄積型の適応的ラベル再重み付けを用いて、分類器のヘッドクラスへのバイアスを軽減する。
- 長尾分布およびバランスの取れた画像分類ベンチマークの両方でバックボーンの一般化性能を向上させる。
提案手法
- 同じバッチ内のグローバルに混合された(MixUp)およびローカルに混合された(CutMix)増幅からの表現間の負のコサイン類似度を最小化するグローバル・ローカル混合一貫性損失を導入する。
- バックプロパゲーション中の一貫性損失の学習を安定化させるために、ストップグラデント操作を適用する。
- 実証的クラス頻度を用いて、ヘッドクラスとテールクラスの混合ラベルに重みを付け、クラスバランスの取れた損失成分を生成する。
- 標準的な交差エントロピー損失と再重み付け損失を、訓練エポックに伴い蓄積される係数を用いて組み合わせる。
- アーキテクチャの変更や追加コンponentを必要とせず、監視学習における補助損失として本手法を実装する。
- 分離された表現事前学習や分類器のファインチューニングを必要とせず、エンドツーエンドで1段階でモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1マルチステージ学習を伴わず、1段階学習戦略が長尾分布の視覚認識におけるヘッドクラスバイアスを効果的に軽減できるか?
- RQ2グローバルおよびローカルなデータ増幅の一貫性を組み合わせることで、特徴抽出器のロバスト性がどのように向上するか?
- RQ3適応的かつエポック蓄積型のラベル再重み付けは、長尾データセットにおけるヘッドクラスへのバイアスをどの程度軽減できるか?
- RQ4提案手法は長尾ベンチマークを超えて、ImageNet や CIFAR のようなバランスの取れたデータセットに対しても一般化可能か?
- RQ5混合一貫性と蓄積的再重み付けの相対的寄与度は、全体の性能向上にどの程度寄与しているか?
主な発見
- CIFAR-100-LT(不均衡要因100)では、GLMCが83.05%のTop-1精度を達成し、PaCoより3.95%、バニラ交差エントロピー法より7.77%優れている。
- ImageNet-LTでは、GLMCが80.2%のTop-1精度を達成し、PaCoより0.9%、SupConより1.8%優れている。
- グローバルおよびローカル混合一貫性損失のみを用いることで、CIFAR-100-LT(不均衡要因100)で精度が11.81%(38.3%から50.11%)向上した。
- 蓄積的再重み付け戦略はヘッドクラスバイアスを顕著に軽減し、最適な性能はラベル再重み付け係数1.0で達成された。
- バランスの取れたImageNetおよびCIFAR-100においても、GLMCはバックボーンの一般化性能を向上させ、長尾特化の修正を加えずに80.2%のTop-1精度を達成した。
- アブレーションスタディにより、両方の要素(混合一貫性と蓄積的再重み付け)が不可欠であり、両方を併用した際に最高の性能が得られたことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。