[論文レビュー] Multi-fidelity Neural Architecture Search with Knowledge Distillation
本稿では、初期段階のアーキテクチャランク付けのため、知識蒸留(KD)損失を用いて低精度評価の精度を向上させる、多精度ニューラルアーキテクチャ探索手法MF-KDを提案する。共クリギングを用いたベイジアン多精度最適化フレームワークに、KDに基づく低精度評価を統合することで、NAS-Bench-201において最先端の性能を達成し、CIFAR-10、CIFAR-100、ImageNet-16-120でBOHB や Regularized Evolution などのベースラインを上回った。計算コスト予算が12,000秒の条件下で実現した。
Neural architecture search (NAS) targets at finding the optimal architecture of a neural network for a problem or a family of problems. Evaluations of neural architectures are very time-consuming. One of the possible ways to mitigate this issue is to use low-fidelity evaluations, namely training on a part of a dataset, fewer epochs, with fewer channels, etc. In this paper, we propose a bayesian multi-fidelity method for neural architecture search: MF-KD. The method relies on a new approach to low-fidelity evaluations of neural architectures by training for a few epochs using a knowledge distillation. Knowledge distillation adds to a loss function a term forcing a network to mimic some teacher network. We carry out experiments on CIFAR-10, CIFAR-100, and ImageNet-16-120. We show that training for a few epochs with such a modified loss function leads to a better selection of neural architectures than training for a few epochs with a logistic loss. The proposed method outperforms several state-of-the-art baselines.
研究の動機と目的
- 神経アーキテクチャ探索(NAS)の高い計算コストを低減するため、アーキテクチャ選択の質を損なわず、低精度評価を高速化すること。
- 探索中のより正確なアーキテクチャランク付けを可能にするために、初期段階(低精度)と最終段階(高精度)の性能指標の相関を向上させること。
- 知識蒸留を活用して低精度評価の信頼性を向上させる多精度ベイジアン最適化フレームワークの構築。
- わずか数エポックのKDベースの学習でも、標準的な交差エントロピー学習に比べて優れたアーキテクチャ選択が得られることを示すこと。
- 複数のベンチマークデータセットで、固定された計算コスト予算内において最先端のNAS性能を達成すること。
提案手法
- 新規な低精度評価戦略の提案:標準的な交差エントロピーの代わりに、知識蒸留(KD)損失を用いて1エポックのみでニューラルアーキテクチャを学習する。
- 特徴マップの蒸留(NST損失)を用い、学生と教師ネットワークの中間層の活性化を一致させることで、一般化性能と初期段階の性能予測精度を向上させる。
- 共クリギング回帰を用いて、多精度ベイジアン最適化フレームワークにKDベースの低精度評価を統合し、精度レベルをモデル化する。
- 共クリギングを用いたガウス過程回帰を適用し、低精度および高精度性能を同時にモデル化することで、効率的な獲得関数最適化を実現する。
- アーキテクチャ間で重みを共有するスーパーネットを用い、探索中の効率的な学習と評価を可能にする。
- 期待改善(EI)獲得関数を用いて探索プロセスを最適化し、アーキテクチャ空間における探索と活用のバランスを取る。
実験結果
リサーチクエスチョン
- RQ1標準的な交差エントロピー学習と比較して、知識蒸留はニューラルアーキテクチャ探索における低精度評価の質を向上させるか?
- RQ2KDベースの初期学習を用いることで、低精度評価と高精度評価の性能指標の相関が向上するか?
- RQ3KD強化された低精度評価を統合した多精度ベイジアン最適化フレームワークは、同じ計算コスト予算下で、既存の最先端NAS手法を上回るか?
- RQ4提案手法MF-KDは、CIFAR-10、CIFAR-100、ImageNet-16-120を含む多様なデータセットに対して堅牢か?
- RQ5初期学習におけるKDの使用は、標準学習や他の多精度ベースラインと比較して、より優れたアーキテクチャ発見を可能にするか?
主な発見
- CIFAR-10ではMF-KDが93.93%のテスト精度を達成し、2番目に良い手法(Regularized Evolutionの93.92%)を統計的に有意なp値 < 0.05で上回った。
- CIFAR-100ではMF-KDが72.00%の精度を達成し、BOHB(70.85%)と教師モデルであるResNet(70.86%)を上回り、探索空間の上位0.2%にランクされた。
- ImageNet-16-120ではMF-KDが45.67%の精度を達成し、BOHB(44.42%)とResNet教師モデル(44.63%)を上回り、探索空間の上位0.5%にランクされた。
- 1エポック評価において、NST損失を用いた学習は、標準的な交差エントロピー学習と比較して、低精度評価と高精度評価のケンダール・トウ順位相関を12.5%向上させた。
- アブレーションスタディの結果、多精度最適化とKDベースの低精度評価の両方が性能向上に寄与しており、特にCIFAR-100やImageNet-16-120のような複雑なデータセットにおいて顕著であった。
- 3つのベンチマークすべてで、教師ネットワーク(ResNet)よりも高いテスト精度を持つアーキテクチャが発見されたことから、KDの有効性がモデル圧縮を超えて実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。