Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Concentration: Learning 100K Object Classifiers in a Single CNN

Jiyang Gao, Zijian Guo|arXiv (Cornell University)|Nov 21, 2017
Advanced Neural Network Applications参考文献 18被引用数 21
ひとこと要約

本論文では、多数の専門家ネットワークから1つのコンactな学生モデルに知識を転送する、マルチティーチャー・シングルスタディオ知識蒸留フレームワーク「Knowledge Concentration」を提案する。これにより、10万個のオブジェクトカテゴリにおける高精度な分類が可能になる。自己 paced 学習と構造的に接続された層を統合することで、OpenImagesおよび新しい10万クラスのデータセット(EFT)の両方で最先端の性能を達成し、一般化ベースラインを最大3.8ポイント上回った。

ABSTRACT

Fine-grained image labels are desirable for many computer vision applications, such as visual search or mobile AI assistant. These applications rely on image classification models that can produce hundreds of thousands (e.g. 100K) of diversified fine-grained image labels on input images. However, training a network at this vocabulary scale is challenging, and suffers from intolerable large model size and slow training speed, which leads to unsatisfying classification performance. A straightforward solution would be training separate expert networks (specialists), with each specialist focusing on learning one specific vertical (e.g. cars, birds...). However, deploying dozens of expert networks in a practical system would significantly increase system complexity and inference latency, and consumes large amounts of computational resources. To address these challenges, we propose a Knowledge Concentration method, which effectively transfers the knowledge from dozens of specialists (multiple teacher networks) into one single model (one student network) to classify 100K object categories. There are three salient aspects in our method: (1) a multi-teacher single-student knowledge distillation framework; (2) a self-paced learning mechanism to allow the student to learn from different teachers at various paces; (3) structurally connected layers to expand the student network capacity with limited extra parameters. We validate our method on OpenImage and a newly collected dataset, Entity-Foto-Tree (EFT), with 100K categories, and show that the proposed model performs significantly better than the baseline generalist model.

研究の動機と目的

  • 10万個の細分化された画像カテゴリを1つのCNNで学習する課題に取り組むこと。これは、モデル容量の制限と遅い学習速度に起因する。
  • 異なる分野(例:鳥、車)に特化した多数の個別専門家ネットワークを展開する際の非効率性と高コストを克服すること。
  • パフォーマンスを損なわずに、複数の専門家ティーチャーから1つの効率的な学生モデルへの知識転送を効果的に行う手法を開発すること。
  • パrameterの増加を最小限に抑えながら、スケーラブルでリソース効率の良いアーキテクチャを設計すること。
  • 新しく収集した10万クラスのデータセット(Entity-Foto-Tree)およびOpenImagesの両方で、本手法の有効性を検証すること。一般化ベースラインおよび専門家ベースラインを上回る性能を示す。

提案手法

  • 複数の専門家ネットワーク(ティーチャー)から1つの汎用的で一般化された学生モデルへの知識蒸留を実現するマルチティーチャー・シングルスタディオ知識蒸留フレームワークを採用する。
  • 自己 paced 学習メカニズムにより、学生が異なるティーチャーから異なる速度で学習できるようにし、学生が異なる教科を異なるペースで知識を吸収するのを模倣する。
  • 構造的に接続された層を導入することで、汎用ユニットを用いた垂直間の表現と、垂直内での特化を実現する個別ユニットを組み合わせ、最小限の追加パラメータで学生モデルの容量を拡張する。
  • 学生モデルは、ティーチャーネットワークのソフトラベルが学生の出力分布をガイドする知識蒸留損失を用いて訓練される。
  • Adagrad最適化を用い、50台のGPUワーカーで学習を実行し、新しく収集した10万クラスのデータセット(EFT)およびOpenImagesの両方へ適用する。
  • ベースネットワークは、Inception-V2の「Mixed_1」から「Mixed_3c」までの層を用い、最終の28×28×256特徴マップをグローバル平均プーリングにより256次元ベクトルに変換する。

実験結果

リサーチクエスチョン

  • RQ1数十体の専門家ネットワークからの知識を、1つの学生モデルに効果的に転送することで、10万クラスの画像分類において高い性能を達成できるか?
  • RQ2複数の複雑さの異なるティーチャーから学習するにあたり、自己 paced 学習メカニズムが学生の学習能力を向上させるか?
  • RQ3構造的に接続された層は、パrameter数の著しい増加を伴わずにモデル容量を拡張できるか?
  • RQ4大規模データセット上での精度と効率性の観点から、本手法は一般化ベースラインおよび専門家ベースラインと比較してどのように差をつけるか?
  • RQ5学生モデルと専門家モデルの性能差は、ボトルネック層のサイズと学習設定に依存するか?

主な発見

  • マルチティーチャー蒸留フレームワークにより、OpenImagesにおける平均垂直ごとの平均精度(mAP)が、一般化ベースラインの62.0から63.2に向上した。
  • 構造的に接続された層の導入により、性能が63.2から64.0に向上し、パラメータの増加を最小限に抑えながら効果的な容量拡張が可能であることが示された。
  • 垂直レベルの自己 paced 学習を組み込むことで、さらに性能が65.8に向上し、適応的学習速度が知識転送を強化することが明らかになった。
  • EFTデータセットでは、学生モデルが一般化ベースラインを大きく上回り、専門家モデルとの性能差も顕著に縮小した。
  • OpenImagesでは学生モデルと専門家モデルの性能差がEFTよりも小さく、主にEFTの専門家モデルに4096のボトルネック層が使用されているのに対し、OpenImagesでは一般化モデルおよび専門家モデルともに512のボトルネック層が使用されているためである。
  • 本手法は両データセットで一貫して性能向上を示し、知識蒸留、自己 paced 学習、構造的に接続された層の有効性が、10万クラスへのCNNスケーリングに寄与していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。