[論文レビュー] ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-Shot
ACEは、重複する不均衡なサブセット上で専門的なエキスパートを訓練することで、補完的知識学習を実現する、1段階でエンドツーエンドに動作するマルチエキスパートフレームワークを提案する。分布に適応する最適化手法と補完的損失関数を用いることで、従来の「ジレンマ的」なトレードオフを打ち破り、CIFAR10-LT、CIFAR100-LT、ImageNet-LT、iNaturalistでSOTAの1段階手法よりも3–10%の精度向上を達成した。
One-stage long-tailed recognition methods improve the overall performance in a "seesaw" manner, i.e., either sacrifice the head's accuracy for better tail classification or elevate the head's accuracy even higher but ignore the tail. Existing algorithms bypass such trade-off by a multi-stage training process: pre-training on imbalanced set and fine-tuning on balanced set. Though achieving promising performance, not only are they sensitive to the generalizability of the pre-trained model, but also not easily integrated into other computer vision tasks like detection and segmentation, where pre-training of classifiers solely is not applicable. In this paper, we propose a one-stage long-tailed recognition scheme, ally complementary experts (ACE), where the expert is the most knowledgeable specialist in a sub-set that dominates its training, and is complementary to other experts in the less-seen categories without being disturbed by what it has never seen. We design a distribution-adaptive optimizer to adjust the learning pace of each expert to avoid over-fitting. Without special bells and whistles, the vanilla ACE outperforms the current one-stage SOTA method by 3-10% on CIFAR10-LT, CIFAR100-LT, ImageNet-LT and iNaturalist datasets. It is also shown to be the first one to break the "seesaw" trade-off by improving the accuracy of the majority and minority categories simultaneously in only one stage. Code and trained models are at https://github.com/jrcai/ACE.
研究の動機と目的
- 1段階の長尾認識における長年の「ジレンマ的」なトレードオフに取り組むこと。これは、少数クラスの精度を向上させると多数クラスの性能が低下する傾向がある。
- 事前学習を必要とし、検出やセグメンテーションタスクに統合しにくい多段階の訓練パイプラインに依存しないこと。
- エキスパートがその支配的サブセットに特化しつつ、重複するあまり見られないカテゴリでは補完的であることを可能にする1段階でエンドツーエンドのフレームワークを設計すること。
- 各エキスパートの訓練データサイズに応じて学習率を調整する分布に適応する最適化手法を開発し、過学習を防ぐこと。
- 事前学習や段階的訓練を一切行わず、長尾ベンチマークで最先端の性能を達成すること。
提案手法
- ACEは、長尾データセットの重複する異なるサブセットで訓練されるマルチエキスパートアーキテクチャを採用しており、各エキスパートがその支配的クラスに特化できるように設計されている。
- エキスパートは共通のバックボーンを共有し、重複するクラス分割における共同意思決定を促進する補完的損失関数を用いて並列に訓練される。
- 分布に適応する最適化手法は、各エキスパートの訓練データサイズに基づいて学習率をスケーリングし、線形または平方根スケーリングを用いて収束性をバランスさせ、過学習を防ぐ。
- 全エキスパートの出力を各データ分割ごとに再スケーリングし、平均化して最終予測を生成する。スケーリングによりヘッドクラスの精度が保持される。
- 事前学習なしでエンドツーエンドから訓練可能であり、検出やセグメンテーションなどの他のビジョンタスクへのプラグアンドプレイ統合が可能である。
- Mixupによるデータ拡張が適用され、超パrameter $α$ が調整されて、全体の精度に顕著な影響を与えることなく耐性を高める。
実験結果
リサーチクエスチョン
- RQ11段階の認識フレームワークは、長尾データセットにおけるヘッドクラスとテールクラスの両方の精度を同時に向上させ、『ジレンマ的』なトレードオフを打ち破ることができるか?
- RQ2マルチエキスパートモデルは、支配的サブセットに特化しつつ、重複するあまり頻度の低いカテゴリでも補完的であるように設計できるか?
- RQ3極めて不均衡なデータ分布を持つエキスパートを、過学習を防ぎつつ効果的に訓練する最適化戦略は何か?
- RQ4分布に適応する学習率スケジューリングは、1回の訓練段階で全クラス頻度スプリットにおいて性能を向上させられるか?
- RQ5多段階訓練や事前学習なしに、長尾認識でSOTAの性能を達成することは可能か?
主な発見
- ACEは、CIFAR10-LT、CIFAR100-LT、ImageNet-LT、iNaturalist2018ベンチマークで、現在の1段階SOTA手法よりも3–10%の絶対的精度向上を達成した。
- CIFAR100-LT-100では、全クラスでトップ1精度49.4%、マニーショットで66.1%、ミディアムショットで55.7%、フェイシュットで23.5%を記録し、すべてのベースラインを上回った。
- 線形スケーリング($\eta_i^{\text{linear}}$)を用いた分布に適応する最適化手法が、平方根スケーリングや均一スケーリングよりも優れた性能を示し、特にミディアムショットおよびフェイシュットスプリットで顕著であった。
- スケーリングを施したグループ平均アグリゲーション(ACE)は、グループ最大値、連結、非スケーリング平均よりも優れており、ヘッドクラスの精度を保持するとともに過信を軽減した。
- Mixup拡張に $\alpha = 0.3$ を使用した場合が全体の性能で最良であったが、その影響は限定的であり、ハイパーパramータの選択に対して頑健であることが示唆された。
- ACEは、マジョリティクラスを犠牲にすることなく、3つの頻度スプリット(マニア、ミディアム、フェイシュット)の精度を同時に向上させた最初の1段階手法である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。