[論文レビュー] CATE: Computation-aware Neural Architecture Encoding with Transformers
CATEは、変換に基づく固定型の計算認識エンコーディングの限界を克服するため、変換可能なTransformerを用いたペairワイズ事前学習スキームを採用し、ニューラルアーキテクチャの密な文脈依存表現を学習する計算認識エンコーディング手法を提案する。計算的に類似したアーキテクチャペアに対してマスクされた言語モデリングを適用し、因果的アテンションを組み合わせることで、CATEは、訓練済み探索空間内および外のNASベンチマークにおいて、隣接行列のような固定エンコーディングベースラインを上回る優れた性能と一般化能力を達成する。
Recent works (White et al., 2020a; Yan et al., 2020) demonstrate the importance of architecture encodings in Neural Architecture Search (NAS). These encodings encode either structure or computation information of the neural architectures. Compared to structure-aware encodings, computation-aware encodings map architectures with similar accuracies to the same region, which improves the downstream architecture search performance (Zhang et al., 2019; White et al., 2020a). In this work, we introduce a Computation-Aware Transformer-based Encoding method called CATE. Different from existing computation-aware encodings based on fixed transformation (e.g. path encoding), CATE employs a pairwise pre-training scheme to learn computation-aware encodings using Transformers with cross-attention. Such learned encodings contain dense and contextualized computation information of neural architectures. We compare CATE with eleven encodings under three major encoding-dependent NAS subroutines in both small and large search spaces. Our experiments show that CATE is beneficial to the downstream search, especially in the large search space. Moreover, the outside search space experiment demonstrates its superior generalization ability beyond the search space on which it was trained. Our code is available at: https://github.com/MSU-MLSys-Lab/CATE.
研究の動機と目的
- 固定変換に基づく計算認識エンコーディングの限界、特に一般化性能の低さと効果のない事前学習の問題を解決すること。
- Transformerにおける自己およびクロスアテンションメカニズムを活用して、深層的な文脈依存表現を用いることで、計算認識エンコーディングの表現力の向上を図ること。
- 長距離依存関係と計算局所性を捉えることのできるペアワイズ学習スキームを用いて、アーキテクチャエンコーダーの効果的な事前学習を可能にすること。
- 学習された文脈依存エンコーディングが、分布外の探索空間において固定エンコーディングよりも優れた一般化を示すことを実証すること。
- 多様なNASサブルーチンや探索空間に適用可能なスケーラブルで汎用的なアーキテクチャエンコーディング手法を提供すること。
提案手法
- CATEは、計算的に類似したアーキテクチャペアに対して、その一部の演算子をマスクすることで破損させ、モデルがマスクされた演算子を予測するように学習するペアワイズ事前学習スキームを採用する。
- 各ペア内のアーキテクチャを共有重みのTransformerエンコーダーで符号化し、その後、両エンコーディングからの統合情報を取り込むためにクロスアテンションTransformerを用いる。
- 隣接行列から導出される因果的マスクを用いることで、ニューラルアーキテクチャの有向非巡回フローを尊重し、BERTで一般的に用いられる双方向アテンションの代わりに適用する。
- マスク言語モデリング(MLM)目的関数を用いて事前学習することで、深層的かつ文脈依存的な計算表現を学習可能にする。
- 長距離依存関係の強化のため、Floyd-Warshallアルゴリズムの結果を隣接行列に追加して、間接的な接続を捉える。
- 最終的なアーキテクチャエンコーディングはクロスアテンションの出力から得られ、予測ベース探索、強化学習、バンディットベース探索といった下流のNASサブルーチンに利用される。
実験結果
リサーチクエスチョン
- RQ1Transformerを用いたペアワイズ事前学習スキームは、固定変換手法に比べ、より効果的な計算認識エンコーディングを学習できるか?
- RQ2クロスアテンションと因果的マスクの使用は、アーキテクチャの計算フローのモデリングと一般化性能を向上させるか?
- RQ3固定エンコーディング(隣接行列など)と比較して、CATEは探索空間外での一般化性能はどの程度か?
- RQ4アーキテクチャペアのサンプリング戦略、ハイパーパramータ、およびマスクタイプが、下流のNASパフォーマンスに与える影響は何か?
- RQ5CATEは、より大きな未学習の探索空間に対しても、高い正確性と効率を維持しながら、効果的に一般化できるか?
主な発見
- CATEは、訓練済み探索空間外の評価において、隣接行列エンコーディングを大きく上回り、NAS-Bench-101で150クエリ予約条件下で5.94%の検証誤差を達成した。
- 間接的依存関係マスクは直接的マスクを上回り、NAS-Bench-101では0.09%、NAS-Bench-301では0.05%のテスト誤差低減を示し、長距離依存関係のモデリングがエンコーディング品質を向上させることを示した。
- クロスアテンションブロック数($L_c$)とフィードフォワード層の幅($d_{ff}$)を大きくするとNASパフォーマンスが向上し、$L_c=24$ および $d_{ff}=64$ の組み合わせでNAS-Bench-101で最小誤差5.95%を達成した。
- 小さな近隣サイズ $K$ と強い計算局所性($\delta$)がより良いパフォーマンスをもたらし、$\delta = 1 \times 10^6$ および $K=2$ が最適な結果を示した。
- CATEは訓練済み探索空間外でも効果的に一般化し、小規模および大規模なNASベンチマークにおいて優れたロバストネスとスケーラビリティを示した。
- 予測ベース探索、強化学習、バンディットベース探索の3つのエンコーディング依存NASサブルーチンにおいて、SOTA(最先端)のパフォーマンスを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。