Skip to main content
QUICK REVIEW

[論文レビュー] EDAS: Efficient and Differentiable Architecture Search

Hyeong Gwon Hong, Pyunghwan Ahn|arXiv (Cornell University)|Dec 3, 2019
Advanced Neural Network Applications参考文献 21被引用数 4
ひとこと要約

EDAS は、1回の反復ごとに1つのエッジのみをサンプリングして緩和することで、離散的アーキテクチャの挙動を保持し、 pruning 後の性能低下を回避する微分可能アーキテクチャ探索手法を提案する。深層ネットワークの実現を可能にしながら緩和度を最小限に抑えることで、CIFAR-10、CIFAR-100、ImageNet で最先端の精度を達成し、0.125 GPU日という非常に低い探索コストで DARTS や P-DARTS を上回る性能を発揮する。

ABSTRACT

Transferrable neural architecture search can be viewed as a binary optimization problem where a single optimal path should be selected among candidate paths in each edge within the repeated cell block of the directed a cyclic graph form. Recently, the field of differentiable architecture search attempts to relax the search problem continuously using a one-shot network that combines all the candidate paths in search space. However, when the one-shot network is pruned to the model in the discrete architecture space by the derivation algorithm, performance is significantly degraded to an almost random estimator. To reduce the quantization error from the heavy use of relaxation, we only sample a single edge to relax the corresponding variable and clamp variables in the other edges to zero or one. By this method, there is no performance drop after pruning the one-shot network by derivation algorithm, due to the preservation of the discrete nature of optimization variables during the search. Furthermore, the minimization of relaxation degree allows searching in a deeper network to discover better performance with remarkable search cost reduction (0.125 GPU days) compared to previous methods. By adding several regularization methods that help explore within the search space, we could obtain the network with notable performances on CIFAR-10, CIFAR-100, and ImageNet.

研究の動機と目的

  • 過パラメータ化されたワンショットネットワークと pruning 後の量子化誤差によって引き起こされる微分可能アーキテクチャ探索における性能低下を解消すること。
  • 従来のワンショット微分可能 NAS 法と比較して、精度を維持または向上させながら探索コストを低減すること。
  • トレーニング中にアーキテクチャパラメータの順位を動的に調整することで、探索空間の探索性を向上させること。
  • 計算量を各エッジに制限することで、メモリと最適化の課題を軽減し、深層ネットワークにおける有効なアーキテクチャ探索を可能にすること。

提案手法

  • EDAS は、1回の反復ごとに1つのエッジのみを緩和し、残りのすべてのエッジを固定することで、最高のアーキテクチャパラメータに基づく1回の操作を実行する。
  • アーキテクチャパラメータは勾配降下法で更新されるが、選択されたエッジ以外は緩和されないため、ネットワークの他の部分は離散的挙動を維持する。
  • 初期エポックにおいて符号反転戦略(EDAS-inv)を適用することで、候補演算の間で学習経験を公平に分配し、探索性を向上させる。
  • 正則化技術を適用することで、探索空間の探索性を高め、早期収束を防ぐ。
  • ワンショットネットワークはエンドツーエンドで訓練され、最終的なアーキテクチャは各エッジについてアーキテクチャパラメータが最大の演算を選択することで導出される。
  • エッジごとの計算量を制限することで、深層アーキテクチャへのスケーラビリティを実現し、深さのギャップ問題を回避する。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化と量子化誤差を回避することで、pruning 後に高い性能を維持できる微分可能アーキテクチャ探索手法は実現可能か?
  • RQ2DARTS が全エッジを同時に緩和するのに対し、1反復ごとに1つのエッジのみを緩和することで、探索効率と最終的なアーキテクチャ品質にどのような影響があるか?
  • RQ3アーキテクチャパラメータの順位をトレーニング中に動的に調整することで、探索空間の探索性が向上し、性能が向上するか?
  • RQ4緩和度を低減させることで、計算コストを最小限に抑えながら、深層ネットワークアーキテクチャにおける有効な探索が可能になるか?
  • RQ5提案手法は、CIFAR-10、CIFAR-100、ImageNet といった複数のベンチマークで、0.125 GPU日未満の探索コストで最先端の性能を達成できるか?

主な発見

  • EDAS は CIFAR-10 で 97.32% のテスト精度を達成し、DARTS(97.12%)や P-DARTS(97.25%)を大きく上回り、探索コストを著しく削減した。
  • CIFAR-100 ではトップ-1精度が 90.68% を達成し、より複雑なデータセットにおいても効果を示しており、従来手法が向上を見せなかった分野でも有効であることが示された。
  • 探索コストは 0.125 GPU 日にまで低減され、DARTS の約 1/12 にまで短縮され、新規タスク向けの迅速なアーキテクチャ発見を可能にした。
  • 初期エポックで符号反転を適用した改良版 EDAS-inv は、標準版 EDAS よりも優れた探索性と高い性能を示し、より優れた探索ダイナミクスであることが示された。
  • EDAS から導出されたアーキテクチャは、トレーニングエポックに伴い一貫した精度向上を示しており、アルゴリズムの効果的な探索能力を裏付けた。
  • EDAS ではアーキテクチャパラメータの順位がトレーニング中に動的に変化するが、α-max とは異なり、順位が早期に安定化しないことから、優れた探索性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。