Skip to main content
QUICK REVIEW

[論文レビュー] Fast Task-Aware Architecture Inference

Efi Kokiopoulou, Anja Hauth|arXiv (Cornell University)|Feb 15, 2019
Advanced Neural Network Applications参考文献 21被引用数 10
ひとこと要約

この論文は、rawデータから直接学習されたメタ特徴量を活用して、さまざまなタスクにおけるモデル性能を予測する勾配ベースでタスクに適応したアーキテクチャ推論フレームワークを提案する。過去の訓練実験に基づいて深層価値ネットワークを訓練することで、勾配上昇による高速かつゼロショットのアーキテクチャ探索が可能となり、新しいタスクにモデルを訓練せずに、高価なNASベースラインに近い性能を達成する。これは、多様なタスクにわたる高い効率性と強力な一般化能力を示している。

ABSTRACT

Neural architecture search has been shown to hold great promise towards the automation of deep learning. However in spite of its potential, neural architecture search remains quite costly. To this point, we propose a novel gradient-based framework for efficient architecture search by sharing information across several tasks. We start by training many model architectures on several related (training) tasks. When a new unseen task is presented, the framework performs architecture inference in order to quickly identify a good candidate architecture, before any model is trained on the new task. At the core of our framework lies a deep value network that can predict the performance of input architectures on a task by utilizing task meta-features and the previous model training experiments performed on related tasks. We adopt a continuous parametrization of the model architecture which allows for efficient gradient-based optimization. Given a new task, an effective architecture is quickly identified by maximizing the estimated performance with respect to the model architecture parameters with simple gradient ascent. It is key to point out that our goal is to achieve reasonable performance at the lowest cost. We provide experimental results showing the effectiveness of the framework despite its high computational efficiency.

研究の動機と目的

  • クラウドMLサービスなどのリソース制約のある環境におけるニューラルアーキテクチャ探索(NAS)の高い計算コストに対処すること。
  • 新しいタスクにモデルを訓練せずに、高速かつ効率的なアーキテクチャ推論を可能にすること。
  • 事前計算された特徴量に依存せず、rawデータサンプルから直接メタ特徴量を学習すること。
  • 過去の訓練実験からの知識移行を通じて、複数のタスクにわたるアーキテクチャ探索コストを軽減すること。
  • 連続的パrameter化と勾配最適化を用いたエンドツーエンドのアーキテクチャ探索のためのスケーラブルで微分可能なフレームワークの開発。

提案手法

  • 価値ネットワークに、関連するタスクからのメタ特徴量と過去の訓練結果を用いて、特定のタスクにおける候補アーキテクチャの性能を予測するように訓練する。
  • メタ特徴量は、価値ネットワーク内のニューラルネットワーク部品を介してrawタスクデータサンプルからエンドツーエンドに学習され、手作業で作成された特徴量に依存しなくなる。
  • モデルアーキテクチャは連続的にパrameter化され、微分可能な最適化が可能となり、効率的な勾配ベースの探索が可能になる。
  • 新しいタスクに対して、価値ネットワークが予測する性能を最大化するために、アーキテクチャパラメータに対して勾配上昇を実行する。
  • オンライン段階では子モデルの訓練を一切必要とせず、価値ネットワークと勾配最適化のみでアーキテクチャ推論が実行される。
  • フレームワークは二段階の構成を採用している:履歴データ上で価値ネットワークを訓練するオフライン段階と、新しいタスクのアーキテクチャを推論するオンライン段階。

実験結果

リサーチクエスチョン

  • RQ1過去の訓練実験に基づいて訓練された深層価値ネットワークは、新しいタスクにおけるアーキテクチャ性能を高い精度で予測できるか?
  • RQ2rawデータから直接学習されたメタ特徴量は、事前計算された特徴量と比較して、性能予測の向上にどの程度寄与するか?
  • RQ3連続空間における勾配ベースのアーキテクチャ探索は、ターゲットタスクに訓練を実施せずに、高性能なモデルを同定するのにどの程度効果的か?
  • RQ4ゼロショットのアーキテクチャ推論は、テスト精度の観点からNASの性能にどの程度近づけるか?
  • RQ5複数のタスクにわたる知識移行は、高い性能を維持したままアーキテクチャ探索コストを顕著に低減できるか?

主な発見

  • 提案手法は、11の多様なNLPタスクにおいて、新しいタスクに訓練を一切行わずに、NASベースラインのテスト精度の1〜3%以内の性能を達成した。
  • 予測された性能と実際の性能の間のスピアマン順位相関係数は、大多数のタスクで約0.8であり、強力な予測能力を示している。
  • 性能予測のためのR2指標は0.6から0.8の範囲にあり、価値ネットワークがタスク間で一般化できることを確認している。
  • 学習されたメタ特徴量の導入により、スピアマンのrhoとR2指標の両方が向上し、性能推定におけるその価値が実証された。
  • すべてのタスクにおいて、提案手法で発見された最良のアーキテクチャは、NASが最初の10個のモデルを試行した際の平均性能を上回っており、優れたサンプル効率性を示している。
  • オンライン段階では子モデルの訓練を一切行わなかったため、計算コストが最小限に抑えられ、高い性能が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。