Skip to main content
QUICK REVIEW

[論文レビュー] K-shot NAS: Learnable Weight-Sharing for NAS with K-shot Supernets

Xiu Su, Shan You|arXiv (Cornell University)|Jun 11, 2021
Machine Learning and Data Classification参考文献 42被引用数 6
ひとこと要約

本稿では、1つのsupernet重み共有をK個のsupernetの辞書に置き換える学習可能な重み共有フレームワーク、K-shot NASを提案する。これにより、simplex-netを介したパス固有の凸結合による重みの組み合わせが可能となり、独立学習重みをより効果的に近似できる。ImageNetでは412M FLOPsのわずかな計算コストで77.9%のTop-1精度を達成した。

ABSTRACT

In one-shot weight sharing for NAS, the weights of each operation (at each layer) are supposed to be identical for all architectures (paths) in the supernet. However, this rules out the possibility of adjusting operation weights to cater for different paths, which limits the reliability of the evaluation results. In this paper, instead of counting on a single supernet, we introduce $K$-shot supernets and take their weights for each operation as a dictionary. The operation weight for each path is represented as a convex combination of items in a dictionary with a simplex code. This enables a matrix approximation of the stand-alone weight matrix with a higher rank ($K>1$). A extit{simplex-net} is introduced to produce architecture-customized code for each path. As a result, all paths can adaptively learn how to share weights in the $K$-shot supernets and acquire corresponding weights for better evaluation. $K$-shot supernets and simplex-net can be iteratively trained, and we further extend the search to the channel dimension. Extensive experiments on benchmark datasets validate that K-shot NAS significantly improves the evaluation accuracy of paths and thus brings in impressive performance improvements.

研究の動機と目的

  • 1ショットNASの限界、すなわちすべてのパスに共通する重みが正確な性能評価を妨げる問題に対処すること。
  • パスが個別に異なる演算重みを学習可能にすることで、supernetベースのNASの信頼性を向上させること。
  • Kショットsupernet辞書とパス固有のコードを用いて、独立学習重みの高ランク行列近似を可能とすること。
  • チャネル幅の探索を非パrametric正則化を用いて拡張し、コード生成における識別性能を向上させること。
  • 学習可能な、アーキテクチャにカスタマイズされた重み共有が、最終的なモデル性能を優れたものにすることを検証すること。

提案手法

  • Kショットsupernetを導入し、各演算が1つの共有重みではなくK個の重みベクトルの辞書を保持する。
  • パスごとの演算重みを、K個の辞書アイテムの凸結合として表現し、単体コードベクトルλを用いる。
  • アーキテクチャとチャネル幅の符号化に基づき、パス固有のコードλを生成するsimplex-netを設計する。
  • 重み共有を高ランク行列近似問題として定式化し、1ショットNASのランク1制限を改善する。
  • 異なるチャネル幅におけるコードの識別性を向上させるために、非パrametric正則化を組み込む。
  • Kショットsupernetとsimplex-netを反復的最適化スキームで同時に学習する。

実験結果

リサーチクエスチョン

  • RQ1学習可能な重み共有を備えたKショットsupernetは、1ショットNASと比較してパス評価の精度を向上させることができるか?
  • RQ2パス固有の単体コードを用いることで、独立学習重みの近似精度はどのように向上するか?
  • RQ3専用の正則化を用いてチャネル幅の探索を拡張することで、最終的なモデル性能は向上するか?
  • RQ4K(supernet数)とトレーニングエポック数の間には、探索効率と精度のトレードオフが存在するか?
  • RQ5提案手法は、低FLOP予算でも最先端の性能を達成できるか?

主な発見

  • K-shot NASは、412M FLOPsのわずかな計算コストでImageNetで77.9%のTop-1精度を達成し、ベースラインの1ショットNAS手法を顕著に上回った。
  • パス固有の重み適応を可能にすることで、評価精度が向上し、supernetランク付けとOracle性能との差が縮小された。
  • Kショット設定において、固定またはランダムなコード割り当てと比較して、学習済みsimplex-netによるコード生成が0.28%の精度向上をもたらした。
  • 学習済み単体コードのヒストグラムは広範かつ多様な分布を示しており、効果的なパス固有の重み適応が実現していることが示された。
  • トレードオフ解析から、K=8がトレーニングコストと性能のバランスが良いことが判明。Kが大きいほど収束に必要なエポック数が増加した。
  • 非パrametric正則化により、異なるチャネル幅におけるコードの識別性が向上し、共同探索における性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。