Skip to main content
QUICK REVIEW

[論文レビュー] Long-Tailed Visual Recognition via Self-Heterogeneous Integration with Knowledge Excavation

Yan Jin, Mengke Li|arXiv (Cornell University)|Apr 3, 2023
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、深さ別知識統合(DKF)と動的知識移行(DKT)を統合することで、ヘッド、ミディアム、テイルクラスの表現学習を向上させる、長尾視覚認識のための新規混合専門家(MoE)フレームワーク、SHIKEを提案する。異なるネットワーク深さからの特徴を統合し、蒸留過程で最も難しいネガティブサンプルを抑制することで、CIFAR100-LTで56.3%、ImageNet-LTで60.3%、iNaturalist 2018で75.4%、Places-LTで41.9%の最先端の精度を達成した。

ABSTRACT

Deep neural networks have made huge progress in the last few decades. However, as the real-world data often exhibits a long-tailed distribution, vanilla deep models tend to be heavily biased toward the majority classes. To address this problem, state-of-the-art methods usually adopt a mixture of experts (MoE) to focus on different parts of the long-tailed distribution. Experts in these methods are with the same model depth, which neglects the fact that different classes may have different preferences to be fit by models with different depths. To this end, we propose a novel MoE-based method called Self-Heterogeneous Integration with Knowledge Excavation (SHIKE). We first propose Depth-wise Knowledge Fusion (DKF) to fuse features between different shallow parts and the deep part in one network for each expert, which makes experts more diverse in terms of representation. Based on DKF, we further propose Dynamic Knowledge Transfer (DKT) to reduce the influence of the hardest negative class that has a non-negligible impact on the tail classes in our MoE framework. As a result, the classification accuracy of long-tailed data can be significantly improved, especially for the tail classes. SHIKE achieves the state-of-the-art performance of 56.3%, 60.3%, 75.4%, and 41.9% on CIFAR100-LT (IF100), ImageNet-LT, iNaturalist 2018, and Places-LT, respectively.

研究の動機と目的

  • 長尾データ分布における深層ニューラルネットワークのヘッドクラスへのバイアスを是正すること。
  • 同じ深さを持つ同種の専門家を用いる従来のMoE手法の限界、すなわちクラス固有の深さの好みを捉えられないことに対処すること。
  • 自己異種統合を通じて浅い部分と深い部分の知識を統合することで、テイルクラスの表現学習を向上させること。
  • MoEフレームワークにおける蒸留過程で、最も難しいネガティブサンプルの悪影響を軽減すること。

提案手法

  • 深さ別知識統合(DKF)を提案。これは、各専門家に対して、ネットワークの浅い部分と深い部分からの中間特徴を統合し、高レベル特徴を生成することで、特徴の多様性と表現能力を向上させる。
  • 動的知識移行(DKT)を導入。これは、多様な専門家から大きな値を示す非ターゲットログティスを特定・再重み付けし、非ターゲット予測を蒸留するための統一的「グランドティーチャー」を形成する。
  • ターゲット知識と非ターゲット知識の両方を用いた知識蒸留を実装。前者は標準的な蒸留損失で処理し、後者はDKTを用いて最も影響力の強いネガティブクラスの影響を抑制する。
  • バランス付きソフトマックス交差エントロピー(BSCE)を用いてMoEモデルを訓練し、DKFとDKTのコンポーネントを同時に最適化することで、長尾クラス全体における一般化性能を向上させる。
  • 各専門家が異なる深さレベル(浅い、中間、深い)の特徴を利用する非均質な専門家アーキテクチャを設計。これにより、専門家が長尾分布の異なる部分に特化できる。
  • 自己蒸留を活用し、浅いネットワークブランチから深い専門家へ知識を移行することで、サンプル数に関係なく自己適応的学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1異なるネットワーク深さからの特徴統合は、長尾視覚認識における表現の多様性と性能向上に寄与するか?
  • RQ2深層ネットワークの特定クラスへの好みは深さに依存するか?その傾向を活用することでテイルクラスの一般化性能を向上できるか?
  • RQ3多様な専門家からの動的知識移行は、蒸留過程で最も難しいネガティブサンプルの影響を効果的に抑制できるか?
  • RQ4MoEベースの長尾学習における専門家の数と非均質性は、性能にどのように影響するか?
  • RQ5浅い特徴と深い特徴からの自己異種統合は、同種の専門家を用いる標準的なMoEよりも優れた一般化性能を達成できるか?

主な発見

  • SHIKEはCIFAR100-LT(IF100)で56.3%の精度を達成し、ベースラインMoEモデルを著しく上回る最先端の性能を示した。
  • ImageNet-LTでは60.3%の精度を達成し、大規模な長尾データに対して優れた一般化性能を示した。
  • iNaturalist 2018では75.4%のトップ-1精度に達し、細分化された長尾ベンチマークにおいても強力なロバストネスを示した。
  • Places-LTでは41.9%の精度を達成し、極端なクラス不均衡が生じるシーン認識タスクにおいても有効性を示した。
  • アブレーションスタディの結果、DKFは基礎的コンポーネントであり、他のコンポーネントを除外した場合でも0.59%の精度向上を寄与した。
  • DKTはCIFAR100-LTで高確率の最も難しいネガティブサンプルの数を30%削減した。これにより、蒸留過程でのネガティブ干渉の抑制効果が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。