[論文レビュー] Generative Teaching Networks: Accelerating Neural Architecture Search by Learning to Generate Synthetic Training Data
GTNはメタ勾配を用いて合成トレーニングデータとカリキュラムを生成することを学習し、学習を加速させ、GTN生成データを用いてアーキテクチャを評価することでNASをより速く実現します。GTN-NASは、大幅に計算を削減しつつ競争力のある最新成果を達成します。
This paper investigates the intriguing question of whether we can create learning algorithms that automatically generate training data, learning environments, and curricula in order to help AI agents rapidly learn. We show that such algorithms are possible via Generative Teaching Networks (GTNs), a general approach that is, in theory, applicable to supervised, unsupervised, and reinforcement learning, although our experiments only focus on the supervised case. GTNs are deep neural networks that generate data and/or training environments that a learner (e.g. a freshly initialized neural network) trains on for a few SGD steps before being tested on a target task. We then differentiate through the entire learning process via meta-gradients to update the GTN parameters to improve performance on the target task. GTNs have the beneficial property that they can theoretically generate any type of data or training environment, making their potential impact large. This paper introduces GTNs, discusses their potential, and showcases that they can substantially accelerate learning. We also demonstrate a practical and exciting application of GTNs: accelerating the evaluation of candidate architectures for neural architecture search (NAS), which is rate-limited by such evaluations, enabling massive speed-ups in NAS. GTN-NAS improves the NAS state of the art, finding higher performing architectures when controlling for the search proposal mechanism. GTN-NAS also is competitive with the overall state of the art approaches, which achieve top performance while using orders of magnitude less computation than typical NAS methods. Speculating forward, GTNs may represent a first step toward the ambitious goal of algorithms that generate their own training data and, in doing so, open a variety of interesting new research questions and directions.
研究の動機と目的
- データ生成ネットワークが、学習者に効率的に教える合成データを生み出せるかを調査する。
- 内部学習者の訓練と外部生成器の最適化を組み込んだメタ学習フレームワーク(GTN)を開発する。
- 実データを基準とした場合に、GTN生成データがNASを加速できることを示す。
- GTNトレーニングの安定性向上とカリキュラムの利点を示す。
- CIFAR10 NASへのGTN適用を通じて、加速された競争力のあるアーキテクチャ探索を示す。
提案手法
- 二重の訓練ループ: 内側のループはGTN生成データで学習者を訓練し、外側のループは実データ上の学習者性能を最大化するようGTNを更新する。
- ジェネレーター G(z,y) はガウスノイズ z とラベル y から合成データ x を作成する;学習者はSGDまたはAdamで固定数の内部ステップを用いて訓練される。
- 外部ループのメタ目的は実データ上で学習者を評価し、内部ループを通して逆伝播してGTNパラメータを更新する。内部ループ最適化子のハイパーパラメータも学習される。
- ウェイト正規化はメタ勾配訓練を安定化させるために適用され、WをW=g·V/||V||としてgとVを更新するようにしてWを直接更新しない。
- カリキュラム学習は入力 z-コードまたは固定入力サンプルを学習することにより有効化され、GTNがデータ生成と提示順序を制御できる(完全なカリキュラムが他より優れている)。
- GTNベースのデータは実際のデータの代わりにGTNデータを用いてアーキテクチャ評価を実施することでNASを加速し、CIFAR10アーキテクチャの代理評価をより速く可能にする。
実験結果
リサーチクエスチョン
- RQ1異なる学習者アーキテクチャと初期化に跨って学習を加速する合成データを生成するよう、ニューラルネットワーク生成器は学習できるか?
- RQ2学習されたカリキュラムは、純粋なランダムデータ生成よりGTNの効果を向上させるか?
- RQ3GTN生成データは、アーキテクチャの品質を維持または向上させつつ、NAS評価コストを劇的に削減できるか?
- RQ4GTNにおける安定性を高める技術(例: ウェイト正規化)は何か?
- RQ5GTN生成データはNAS探索空間と代理評価へどれだけ一般化するか?
主な発見
- GTNsは学習をより速く可能にする合成データを生成し、実データやデータセット蒸留ベースラインよりも少数ステップの精度が高い。
- ウェイト正規化はメタ勾配GTN訓練の安定性と頑健性を著しく向上させる。
- 完全なGTNカリキュラム(サンプル順序と組成の両方を学習)は他のカリキュラム系を上回る。
- GTNベースのデータはMNISTとCIFAR10の少数ステップ学習を加速し、実データ性能と相関する効率的なNAS代理評価を可能にする。
- CIFAR10 NASでは、GTN評価は実データ評価に比べ約9倍速くアーキテクチャ評価を実現し、Cutout augmentationと組み合わせると競争力のあるまたは優れた結果を達成する。
- GTNベースの代理評価は tested の探索設定内で最先端の結果を達成し、トップアーキテクチャの真の性能との相関も改善する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。