Skip to main content
QUICK REVIEW

[論文レビュー] DC-NAS: Divide-and-Conquer Neural Architecture Search

Yunhe Wang, Yixing Xu|arXiv (Cornell University)|May 29, 2020
Advanced Neural Network Applications参考文献 43被引用数 4
ひとこと要約

DC-NASは、収束特徴表現に基づいてサブネットワークをクラスタリングし、各クラスタから最良のアーキテクチャを選択・統合することで、評価精度を向上させる分割統治アプローチを提案する。同じFLOPs制約下でImageNetで75.1%のトップ1精度を達成し、最先端のNAS手法を上回る性能を示した。

ABSTRACT

Most applications demand high-performance deep neural architectures costing limited resources. Neural architecture searching is a way of automatically exploring optimal deep neural networks in a given huge search space. However, all sub-networks are usually evaluated using the same criterion; that is, early stopping on a small proportion of the training dataset, which is an inaccurate and highly complex approach. In contrast to conventional methods, here we present a divide-and-conquer (DC) approach to effectively and efficiently search deep neural architectures. Given an arbitrary search space, we first extract feature representations of all sub-networks according to changes in parameters or output features of each layer, and then calculate the similarity between two different sampled networks based on the representations. Then, a k-means clustering is conducted to aggregate similar architectures into the same cluster, separately executing sub-network evaluation in each cluster. The best architecture in each cluster is later merged to obtain the optimal neural architecture. Experimental results conducted on several benchmarks illustrate that DC-NAS can overcome the inaccurate evaluation problem, achieving a $75.1\%$ top-1 accuracy on the ImageNet dataset, which is higher than that of state-of-the-art methods using the same search space.

研究の動機と目的

  • 従来の神経ネットワークアーキテクチャ探索(NAS)における早期停止の不安定性と不正確さ、特に収束が速いアーキテクチャにバイアスがかかる問題を解決すること。
  • 大規模な探索空間の評価複雑度を軽減するため、類似したアーキテクチャをクラスタにグループ化して効率的な比較を可能にすること。
  • 各クラスタから最良のアーキテクチャを選択し、それらを統合することで、優れた最終モデルを構築することにより、探索性能を向上させること。
  • 収束ダイナミクスに基づくクラスタリングが、すべてのアーキテクチャに均一に早期停止を適用するのと比較して、より良い一般化性能と高い精度をもたらすことを示すこと。

提案手法

  • 訓練エポックにわたる層出力特徴の変化を追跡することで、サブネットワークの特徴表現を抽出し、収束速度と挙動を捉える。
  • 抽出された特徴表現を用いて、アーキテクチャ間の類似度を計算し、類似したアーキテクチャをグループ化する。
  • 収束ダイナミクスにおけるアーキテクチャ類似度に基づいて、k-meansクラスタリングを適用し、探索空間をK個のクラスタに分割する。
  • バリデーション精度に基づく性能指標を用いて、各クラスタから最良のサブネットワークを選択する。
  • 各クラスタの最良モデルを統合して、最終的な探索アーキテクチャを構築する。
  • 1000万個のアーキテクチャをサンプリングできる学習済み操作確率を備えたスーパーネットを用い、特徴抽出とクラスタリングに使用する。

実験結果

リサーチクエスチョン

  • RQ1収束ダイナミクスに基づくアーキテクチャのクラスタリングは、均一な早期停止と比較して、NAS評価の信頼性を向上させるか?
  • RQ2類似したアーキテクチャをクラスタに分けることで、最終的なモデル性能が向上するか?
  • RQ3分割統治戦略により、早期停止バイアスによる劣悪なアーキテクチャの選択リスクを低減できるか?
  • RQ4精度、FLOPs、レイテンシの観点から、DC-NASは最先端のNAS手法と比較してどのように性能を発揮するか?

主な発見

  • DC-NASはImageNetバリデーションセットで75.1%のトップ1精度を達成し、ハードウェア効率の良いNASモデルにおいて、新たな最先端水準を樹立した。
  • 同じFLOPs制約下で、FBNetなどのベースライン手法と比較して、探索性能が1.5~2.0%向上した。
  • 総探索コストは231 GPU時間であり、ベースラインのFBNetと比較してわずか1.07倍の増加にとどまり、ほとんど追加コストがないことを示した。
  • 最良のDC-NASモデルのレイテンシ(ARM上118.12ms)は、FBNet-C(116.55ms)と同等であり、優れたハードウェア効率を示した。
  • クラスタ数(K)を5より多くしても顕著な性能向上が得られず、K=5が効果的なクラスタリングに十分であることを示した。
  • 収束行動(構造そのものではなく)が最終性能の強力な指標であることが示され、早期停止バイアスが軽減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。