Skip to main content
QUICK REVIEW

[論文レビュー] Solving Long-tailed Recognition with Deep Realistic Taxonomic Classifier

Tz-Ying Wu, Pedro Morgado|arXiv (Cornell University)|Jul 20, 2020
Domain Adaptation and Few-Shot Learning参考文献 42被引用数 4
ひとこと要約

この論文では、不確実性が高くなった際に、細分化された分類を放棄して粗い、より確信のある予測を行うことで、長尾分布における認識性能を向上させる深層的で現実的な分類器であるDeep-RTCを提案する。訓練時に確率的ツリー・サブセット選択を用い、推論時に複数レベルの退出意思決定を動的に実行することで、Deep-RTCは長尾データセットで最先端の性能を達成し、従来手法よりも最大11%高い正しく予測されたビット数(CPB)を達成する。

ABSTRACT

Long-tail recognition tackles the natural non-uniformly distributed data in real-world scenarios. While modern classifiers perform well on populated classes, its performance degrades significantly on tail classes. Humans, however, are less affected by this since, when confronted with uncertain examples, they simply opt to provide coarser predictions. Motivated by this, a deep realistic taxonomic classifier (Deep-RTC) is proposed as a new solution to the long-tail problem, combining realism with hierarchical predictions. The model has the option to reject classifying samples at different levels of the taxonomy, once it cannot guarantee the desired performance. Deep-RTC is implemented with a stochastic tree sampling during training to simulate all possible classification conditions at finer or coarser levels and a rejection mechanism at inference time. Experiments on the long-tailed version of four datasets, CIFAR100, AWA2, Imagenet, and iNaturalist, demonstrate that the proposed approach preserves more information on all classes with different popularity levels. Deep-RTC also outperforms the state-of-the-art methods in longtailed recognition, hierarchical classification, and learning with rejection literature using the proposed correctly predicted bits (CPB) metric.

研究の動機と目的

  • 長尾データ分布におけるレア(末尾)クラスにおけるディープラーニングモデルの性能低下を解消すること。
  • すべての予測を最も細分化された粒度で強制する平坦な分類器の限界を克服すること。
  • 細分化された分類が不確実な場合に、粗い予測を下すことで人間の認知に類似した分類器を実現すること。
  • 階層的分類における情報回復をよりよく捉えるために、正しく予測されたビット数(CPB)という新しい評価指標を導入すること。
  • 複数の分類ツリーのレベルで動的予測を可能にしながらも、高い信頼性を維持する訓練および推論フレームワークを開発すること。

提案手法

  • 訓練時に、分類ツリーのすべての可能なカットを模倣するように、階層構造に特化した確率的ツリー・サブセット選択(STS)正則化を提案する。これはドロップアウトに類似しているが、階層的構造を対象としている。
  • すべての葉ノードに限らず、分類ツリー内の任意のノードで予測を生成できる動的ソフトマックス分類器を実装する。
  • 推論時に、信頼度がしきい値未満に下がると、中間ノードでツリーから退出できる拒否メカニズムを導入する。
  • 各分類ツリーのレベルで、信頼性のある意思決定が行えるように、確率推定値をキャリブレーションするようにモデルを訓練する。
  • 複数レベルの予測とクラス間の知識伝達をサポートするラベルエンコーディングおよび階層的損失関数を統合する。
  • 訓練時にCPB指標を最適化し、厳密な葉ノードレベルの正答率よりも、正しい情報回復を優先する。

実験結果

リサーチクエスチョン

  • RQ1細分化された予測を許容する階層的分類器は、従来の平坦分類器と比較して、長尾認識性能を向上させることができるか?
  • RQ2中間の分類ツリーのレベルでの動的退出は、さまざまなクラスの出現頻度レベルにおいて、情報回復と予測の信頼度にどのように影響するか?
  • RQ3訓練時に確率的ツリー・サブセット選択を用いることで、長尾設定における一般化性能とロバストネスがどの程度向上するか?
  • RQ4CPBを介して部分的な正しい予測を優先するモデルは、最先端の平坦および階層的手法と比較して、長尾認識性能で優れているか?
  • RQ5動的で信頼度に配慮した分類器は、多数の例があるクラスの精度を損なうことなく、少数の例があるクラスにおける性能低下を軽減できるか?

主な発見

  • iNaturalist-LTでは、最先端の平坦分類器と比較してCPBで9%の向上を達成し、ImageNet-LTでは11%の向上を達成した。
  • CIFAR100-LT、AWA2-LT、ImageNet-LT、iNaturalist-LTの4つのデータセットすべてにおいて、Deep-RTCはすべてのクラスの出現頻度レベルで高い性能を維持している。これに対して、従来手法は多数の例があるクラスで性能が低下する傾向にあった。
  • 少数の例があるクラスでは、Deep-RTCは約50%の拒否率を達成し、拒否された例の90%以上で階層的正答率が90%を超えた。これは、粗い予測に対する高い信頼度を示している。
  • 拒否率のさまざまな状況において、Deep-RTCは最先端の平坦な現実的予測器(RP)をすべての面で上回った。特に、少数の例と中程度の例があるクラスにおいて、中間ノードでのソフト拒否が可能である点が優位性をもたらした。
  • 複雑な分岐構造を追加する他の手法とは異なり、より単純なアーキテクチャでも、Deep-RTCは階層的分類ベンチマークで優れた結果を達成した。
  • CPB指標は、Deep-RTCが、誤った葉ノードレベルの予測よりも正しい中間レベルの予測を優先することで、特に低頻度クラスにおいて、従来手法よりもはるかに多くの情報を回復していることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。