Skip to main content
QUICK REVIEW

[論文レビュー] Distilling Virtual Examples for Long-tailed Recognition

Yin-Yin He, Jianxin Wu|arXiv (Cornell University)|Mar 28, 2021
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 5
ひとこと要約

本論文は、教師モデルの予測を仮想例として扱い、長尾視覚認識を改善する知識蒸留手法であるDistilling Virtual Examples (DiVE)を提案する。温度スケーリングと正規化により仮想例の分布を平ららかにすることで、DiVEは尾尾クラスのパフォーマンスを明示的に向上させ、CIFAR-100-LT、ImageNet-LT、iNaturalist2018データセットで最先端の精度を達成した。

ABSTRACT

We tackle the long-tailed visual recognition problem from the knowledge distillation perspective by proposing a Distill the Virtual Examples (DiVE) method. Specifically, by treating the predictions of a teacher model as virtual examples, we prove that distilling from these virtual examples is equivalent to label distribution learning under certain constraints. We show that when the virtual example distribution becomes flatter than the original input distribution, the under-represented tail classes will receive significant improvements, which is crucial in long-tailed recognition. The proposed DiVE method can explicitly tune the virtual example distribution to become flat. Extensive experiments on three benchmark datasets, including the large-scale iNaturalist ones, justify that the proposed DiVE method can significantly outperform state-of-the-art methods. Furthermore, additional analyses and experiments verify the virtual example interpretation, and demonstrate the effectiveness of tailored designs in DiVE for long-tailed problems.

研究の動機と目的

  • データの不均衡により、代表度が低い尾尾クラスでモデルの性能が低下する長尾認識問題に対処すること。
  • モデルの予測を仮想例として解釈することで、カテゴリ間の相互作用を活用し、カテゴリを跨いで知識を転送すること。
  • 仮想例の分布を明示的に制御し、より平らでバランスの取れた分布を促進することで、尾尾クラスの一般化性能を向上させること。
  • iNaturalistのような大規模で現実世界の長尾ベンチマークで、既存の最先端手法を上回る性能を発揮する手法を開発すること。

提案手法

  • 仮想例は、すべての訓練サンプルにおけるモデルの予測されたクラス確率として定義され、各入力がカテゴリレベルで寄与するソフトな貢献として解釈される。
  • 教師モデルの仮想例から学生モデルへの知識蒸留が適用され、カテゴリを跨いで知識が効果的に転送される。
  • 教師の出力分布をなめらかにするために温度スケーリング戦略が用いられ、仮想例の分布がより平らでバランスの取れたものになる。
  • パワー正規化と、ラベル分布学習(DLDL)を近似する蒸留損失を組み合わせることで、仮想例の分布に対する明示的な制御が可能になる。
  • 蒸留のターゲットとして真のラベルを直接使用するのではなく、モデル自身の予測に焦点を当てることで、カテゴリ間の相互作用を促進する。
  • 最終的な損失は、滑らかにされた教師出力からの蒸留とバランスの取れた監督信号を組み合わせており、尾尾クラスへの一般化性能の向上を可能にする。

実験結果

リサーチクエスチョン

  • RQ1モデルの予測(仮想例)からの知識蒸留が、視覚認識における長尾データバイアスを効果的に緩和できるか?
  • RQ2仮想例の分布が長尾認識モデルのパフォーマンスにどのように影響するか?
  • RQ3温度スケーリングと正規化による仮想例分布の平らさの向上が、尾尾クラスにおける一般化性能の向上に寄与するか?
  • RQ4仮想例の解釈は長尾認識に対して妥当で効果的であり、従来の重み付けやリサンプリング手法と比較してどのように異なるか?
  • RQ5仮想例蒸留によって訓練された学生モデルは、実世界の長尾データセットで教師モデルおよび既存の最先端手法を上回る性能を発揮できるか?

主な発見

  • DiVEはCIFAR-100-LT(β=100)で51.66%の精度を達成し、RIDE教師モデル(51.07%)および最先端手法を上回り、最先端の性能を示した。
  • iNaturalist2018では73.44%の精度を達成し、RIDE手法(72.60%)を上回り、新たな最先端を樹立した。
  • FULL教師(CIFAR-100を完全に訓練)の仮想例分布はCE教師よりも顕著に平らであり、この平らさと学生の精度(61.58% 対 38.35%)の相関が確認された。
  • 温度τ=3およびパワー正規化を用いることで、仮想例分布が最も平らになり、最高の精度(CIFAR-100-LTで62.00%)が得られた。これは分布制御の重要性を裏付けた。
  • DiVEにおけるBSCE損失項を除去するとパフォーマンスがわずかに低下したが、DLDLオンativeバージョンでも大多数のベースラインを上回った。これにより、仮想例蒸留自体の有効性が裏付けられた。
  • アブレーションスタディの結果、蒸留ターゲットに真のラベル($\tilde{\vec{t}}$)を用いることでパフォーマンスが悪化した。これは、純粋なモデル予測からの蒸留がより効果的であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。