[論文レビュー] Generalizing Few-Shot NAS with Gradient Matching
本稿では、勾配類似度スコア(GM)を用いてスーパーネットをサブスーパーネットに知的に分割することで、有害な重み共有を軽減する一般化された少数ショットニューラルアーキテクチャ探索(NAS)手法であるGM-NASを提案する。勾配類似度に基づくエッジのクラスタリングと、予算制約下でのより高いエッジ分割を可能にすることで、GM-NASは、DARTSスケールで2.34%のテスト誤差、ImageNetで19.7%のTop-1誤差を達成し、最先端の性能を発揮するとともに、上位アーキテクチャ間のランク相関を顕著に向上させる。
Efficient performance estimation of architectures drawn from large search spaces is essential to Neural Architecture Search. One-Shot methods tackle this challenge by training one supernet to approximate the performance of every architecture in the search space via weight-sharing, thereby drastically reducing the search cost. However, due to coupled optimization between child architectures caused by weight-sharing, One-Shot supernet's performance estimation could be inaccurate, leading to degraded search outcomes. To address this issue, Few-Shot NAS reduces the level of weight-sharing by splitting the One-Shot supernet into multiple separated sub-supernets via edge-wise (layer-wise) exhaustive partitioning. Since each partition of the supernet is not equally important, it necessitates the design of a more effective splitting criterion. In this work, we propose a gradient matching score (GM) that leverages gradient information at the shared weight for making informed splitting decisions. Intuitively, gradients from different child models can be used to identify whether they agree on how to update the shared modules, and subsequently to decide if they should share the same weight. Compared with exhaustive partitioning, the proposed criterion significantly reduces the branching factor per edge. This allows us to split more edges (layers) for a given budget, resulting in substantially improved performance as NAS search spaces usually include dozens of edges (layers). Extensive empirical evaluations of the proposed method on a wide range of search spaces (NASBench-201, DARTS, MobileNet Space), datasets (cifar10, cifar100, ImageNet) and search algorithms (DARTS, SNAS, RSPS, ProxylessNAS, OFA) demonstrate that it significantly outperforms its Few-Shot counterparts while surpassing previous comparable methods in terms of the accuracy of derived architectures.
研究の動機と目的
- 子アーキテクチャ間の過剰な重み共有による最適化の相関低下が引き起こす性能劣化を是正すること。
- 操作単位での全探索的分割に代わる、より知的な分割基準を導入することで、少数ショットNASを改善すること。
- 子モデル間の勾配類似度を活用することで、探索効率と精度を最大化するスーパーネット分割戦略を開発すること。
- 勾配ベースのクラスタリングにより、エッジごとの分岐次数を低減することで、固定予算下でのより高いエッジ分割を実現すること。
- 多様な探索空間、データセット、NASアルゴリズムにおいて一貫した性能向上を示すこと。
提案手法
- 異なる子モデルの共有重みの勾配間のコサイン類似度を計算する勾配類似度スコア(GM)を提案し、重み共有の妥当性を評価する。
- GMスコアをグラフクラスタリング定式化における重み付きエッジとして用い、有害な重み共有を最小化するようにスーパーネットをサブスーパーネットに分割する。
- 最適なエッジの分割を特定するためのグラフミニカットに基づくエッジ選択戦略を導入し、分散を低減し、性能を向上させる。
- スーパーネットのウォームアップと、分割後のサブスーパーネットの重みリセットを実装し、学習の安定化と残留重み共有効果の排除を図る。
- 1回のエッジ分割で複数のサブスーパーネットを許容することで、任意の分岐次数をサポートし、同じ予算下でより多くのエッジを分割可能にする。
- NASBench-201、DARTS、MobileNetなどの複数のベンチマークおよびDARTS、SNAS、RSPS、ProxylessNAS、OFAなどの複数のアルゴリズムに本手法を適用する。
実験結果
リサーチクエスチョン
- RQ1子モデル間の勾配類似度は、スーパーネット内での重み共有の可否を決定する有効な基準として機能するか?
- RQ2スーパーネットの分割を勾配類似度でガイドすることで、全探索的分割に比べて性能推定と探索結果が向上するか?
- RQ3分岐次数を低減することで、固定予算下でのエッジ分割数を、少数ショットNASよりも増やせるか?
- RQ4既存手法と比較して、GM-NASは上位アーキテクチャ間のランク相関をどの程度向上させられるか?
- RQ5スーパーネットのウォームアップエポック数やリスタート戦略といったハイパーパrameterの選択に、GM-NASはどの程度頑健か?
主な発見
- DARTS探索空間において、GM-NASは2.34%のテスト誤差を達成し、最先端手法の中で最高の順位を獲得した。
- MobileNet探索空間を用いたImageNetでは、GM-NASは19.7%のTop-1テスト誤差を達成し、類似手法を上回った。
- 分岐次数が2の場合、GM-NASは4つのエッジを分割(少数ショットNASでは2つ)し、同じ予算下で3倍のエッジ分割が可能になった。
- NASBench-201の上位1%アーキテクチャ間で、Spearman相関係数0.532を達成し、少数ショットNASの0.117と比べ顕著に高い相関を示した。
- スーパーネットのウォームアップとサブスーパーネットのリスタートは不可欠である:これらを削除すると、CIFAR-10の平均精度は93.95%から91.04%に低下した。
- ミニカットを用いたエッジ選択により、性能の分散が0.08(対象:0.39)に低減し、平均精度が93.95%(対象:93.58%)に向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。