Skip to main content
QUICK REVIEW

[論文レビュー] Towards Oracle Knowledge Distillation with Neural Architecture Search

Minsoo Kang, Jonghwan Mun|arXiv (Cornell University)|Nov 29, 2019
Advanced Neural Network Applications参考文献 39被引用数 5
ひとこと要約

本稿では、ニューラルアーキテクチャ探索(NAS)とオラクル知識蒸留(OD)を組み合わせた、新しい知識蒸留フレームワークを提案する。このフレームワークにより、アンサンブル教師ネットワークから、高精度で効率的な学生モデルを訓練できる。最適な学生アーキテクチャの探索と、最良のアンサンブル予測を模倣するオラクル損失を用いることで、モデル容量のギャップを低減し、精度とメモリ効率の両面で教師モデルおよび標準的な蒸留ベースラインを上回る学生モデルの性能を達成する。

ABSTRACT

We present a novel framework of knowledge distillation that is capable of learning powerful and efficient student models from ensemble teacher networks. Our approach addresses the inherent model capacity issue between teacher and student and aims to maximize benefit from teacher models during distillation by reducing their capacity gap. Specifically, we employ a neural architecture search technique to augment useful structures and operations, where the searched network is appropriate for knowledge distillation towards student models and free from sacrificing its performance by fixing the network capacity. We also introduce an oracle knowledge distillation loss to facilitate model search and distillation using an ensemble-based teacher model, where a student network is learned to imitate oracle performance of the teacher. We perform extensive experiments on the image classification datasets---CIFAR-100 and TinyImageNet---using various networks. We also show that searching for a new student model is effective in both accuracy and memory size and that the searched models often outperform their teacher models thanks to neural architecture search with oracle knowledge distillation.

研究の動機と目的

  • モデル容量の不一致に起因する、知識蒸留における学生モデルと教師モデルの間の持続的な性能ギャップを是正すること。
  • アンサンブル教師からの知識蒸留を向上させることで、各入力に対して最適な教師予測の組み合わせ(オラクル性能)を学生モデルが学習できるようにすること。
  • 事前に学生構造を固定するのではなく、蒸留に最適な高性能でコンパクトな学生アーキテクチャを特定する探索ベースの手法を開発すること。
  • アーキテクチャ探索とオラクル蒸留を組み合わせることで、標準的な蒸留および教師アンサンブルを上回る精度と効率性を実現する学生モデルが得られることを示すこと。

提案手法

  • 各入力に対して、すべての教師モデルの中で最も性能の良い予測を模倣するように学生を訓練する、オラクル知識蒸留(OD)損失を導入する。これは、モデル平均とは異なり、単一の最良の予測を模倣する。
  • ベースとなる学生モデルから出発し、最大で4倍のサイズまで拡張可能な、適応的容量を持つ最適な学生ネットワークアーキテクチャを発見するために、ニューラルアーキテクチャ探索(NAS)を採用する。
  • 操作とスキップ接続を含む微分可能で最適化可能な探索空間を用い、アーキテクチャと重みの両方をエンドツーエンドで最適化可能にする。
  • NASの過程でOD損失を適用し、アンサンブル教師のオラクル性能を最もよく模倣できるアーキテクチャに探索を誘導する。
  • メモリ制約下で探索を実施し、探索空間は標準的なCNNと互換性があり、画像分類に効率的であるように設計されている。
  • 最終的な学生モデルは、探索されたアーキテクチャとOD損失を用いて訓練され、優れた精度とパラメータ効率性を達成する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルアーキテクチャ探索は、固定アーキテクチャの学生モデルよりも優れた性能を示す学生モデルを同定できるか?
  • RQ2各例に対して最良の教師予測を模倣するオラクル知識蒸留は、標準的な蒸留よりも高い学生精度をもたらすか?
  • RQ3NASとODの組み合わせにより、学生とアンサンブル教師間のモデル容量ギャップが低減され、より優れた性能が達成できるか?
  • RQ4探索された学生モデルの性能は、特に精度とメモリ容量の面で、教師アンサンブルと比較してどうなるか?

主な発見

  • 5つのResNet-32モデルからなるアンサンブルを用いたCIFAR-100では、0.89Mパラメータ以上のKDASモデル(ベースモデルの2倍)が、オラクル蒸留損失を用いることで、教師(76.87%)と同等の精度(76.87%)を上回る性能を達成した。
  • KDASモデルは、同等のメモリサイズの標準的な知識蒸留ベースライン(MMNs)を一貫して上回り、アーキテクチャ探索の利点を示した。
  • TinyImageNetでは、ODが標準KDよりも顕著な利点を示し、50.4%のトレーニング例で教師モデル間で異なる最適な予測が得られ、顕著な精度向上が達成された。
  • さまざまなバックボーンアーキテクチャ(ResNet-110、WideResNets)において、KDASが特定した学生モデルは、標準的な蒸留および教師アンサンブルを上回る精度を達成しながら、競争力のあるメモリ使用量を維持した。
  • オラクル損失がなくても、NASで同定された学生モデルは、KD、DML、BSS、TAKDなどの他のKD手法を上回る性能を示した。これは、探索自体の価値を示している。
  • 本手法はモデルに依存しない。CIFAR-100およびTinyImageNetの両方で、多様な学生アーキテクチャに対して一貫した性能向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。