Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing and Mitigating Interference in Neural Architecture Search

Jin Xu, Xu Tan|arXiv (Cornell University)|Aug 29, 2021
Advanced Neural Network Applications参考文献 52被引用数 12
ひとこと要約

この論文は、MAGIC-T で連続する子モデルのサンプル間のトポロジー変化を最小化し、MAGIC-A で共有演算子の入出力を整合化することで、重み共有ニューラルアーキテクチャサーチ(NAS)における干渉を低減するMAGICという手法を提案する。このアプローチにより、予測精度と実際の精度の順位相関が向上し、GLUE開発セットとテストセットにおいてRoBERTaをそれぞれ1.1点および0.6点上回るBERTアーキテクチャを実現した。また、ELECTRAを1.6点および1.1点上回った。

ABSTRACT

Weight sharing is a popular approach to reduce the cost of neural architecture search (NAS) by reusing the weights of shared operators from previously trained child models. However, the rank correlation between the estimated accuracy and ground truth accuracy of those child models is low due to the interference among different child models caused by weight sharing. In this paper, we investigate the interference issue by sampling different child models and calculating the gradient similarity of shared operators, and observe: 1) the interference on a shared operator between two child models is positively correlated with the number of different operators; 2) the interference is smaller when the inputs and outputs of the shared operator are more similar. Inspired by these two observations, we propose two approaches to mitigate the interference: 1) MAGIC-T: rather than randomly sampling child models for optimization, we propose a gradual modification scheme by modifying one operator between adjacent optimization steps to minimize the interference on the shared operators; 2) MAGIC-A: forcing the inputs and outputs of the operator across all child models to be similar to reduce the interference. Experiments on a BERT search space verify that mitigating interference via each of our proposed methods improves the rank correlation of super-pet and combining both methods can achieve better results. Our discovered architecture outperforms RoBERTa$_{ m base}$ by 1.1 and 0.6 points and ELECTRA$_{ m base}$ by 1.6 and 1.1 points on the dev and test set of GLUE benchmark. Extensive results on the BERT compression, reading comprehension and ImageNet task demonstrate the effectiveness and generality of our proposed methods.

研究の動機と目的

  • 重み共有NASにおける干渉の根本的原因を解明すること、特に異なる子モデルから共有演算子が矛盾する勾配更新を受けることによるものである。
  • アーキテクチャの違いと入出力の変化が共有演算子における干渉に与える影響を定量化すること。
  • 連続する子モデルのサンプル間のトポロジー変化を制御することで干渉を低減する手法を提案すること。
  • アーキテクチャの各子モデル間で共有演算子の入出力をアンカーモデルに合わせて整合化するメカニズムを設計し、勾配の競合を低減すること。
  • 提案手法の有効性をBERT事前学習、モデル圧縮、ImageNet分類タスクにおいて検証すること。

提案手法

  • MAGIC-T は、隣接する学習ステップ間で1つの演算子を段階的に変更することで、トポロジーの変化を最小化し、共有重みに対する干渉を低減する。
  • MAGIC-A は、高い性能を示すモデルをアンカーとし、すべての子モデルにおける共有演算子の入出力をアンカーの活性化に合わせて整合化する。
  • 勾配類似度分析を用いて干渉を定量化し、子モデル間の異なる演算子の数が増えるほど干渉が増大することを示している。
  • 共有演算子が子モデル間で類似した入出力分布を持つ場合、干渉が低減されることを観察した。
  • 2つの手法を組み合わせたMAGIC-ATとして統合することで、干渉をさらに低減し、探索性能を向上させることができる。
  • 実験では、BERTおよびMobileNet-V2の探索空間に対して、マルチヘッドアテンション、フィードフォワードネットワーク、畳み込みを統合したハイブリッドスーパーネットを用いた。

実験結果

リサーチクエスチョン

  • RQ1複雑な探索空間で多様な演算子タイプを含む状況下で、重み共有NASにおける干渉に寄与する要因は何か?
  • RQ2連続する子モデル間で異なる演算子の数が、共有重みにおける干渉にどのように影響するか?
  • RQ3子モデル間で共有演算子の入出力の類似度が、干渉にどの程度影響を及えるか?
  • RQ4サンプリングステップ間で段階的なアーキテクチャ変更を施すことで、干渉を低減し、NASにおける精度順位付けを向上させられるか?
  • RQ5アンカーモデルを用いて共有演算子の入出力を整合化することで、干渉を低減し、探索性能を向上させられるか?

主な発見

  • MAGIC-T と MAGIC-A は個別にスーパーネットにおける予測精度と実際の精度の順位相関を向上させ、両者を組み合わせたMAGIC-ATが最も優れた結果をもたらした。
  • 提案手法により、GLUE開発セットとテストセットでそれぞれRoBERTaを1.1点および0.6点上回るBERTアーキテクチャが発見された。
  • 発見されたモデルは、パラメータ数が少ないにもかかわらず、ELECTRAを1.6点および1.1点上回った。
  • SQuAD v1.1およびv2.0の読解タスクでは、RoBERTaに比べてEMスコアが0.6点および0.7点高く、F1スコアが1.7点および2.2点高い結果を得た。
  • ImageNetでは、MAGIC-ATが600M FLOPSの制約下で23.2%のトップ1誤差率を達成し、ProxylessNAS や PC-NAS といった先行NAS手法を上回った。
  • BERTモデルの圧縮タスクにおいても、追加の distillation 技術を用いずに、従来手法を上回るアーキテクチャを発見し、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。