Skip to main content
QUICK REVIEW

[論文レビュー] Neuro-algorithmic Policies enable Fast Combinatorial Generalization

Marin Vlastelica, Michal Rolínek|arXiv (Cornell University)|Feb 15, 2021
Machine Learning and Algorithms参考文献 3被引用数 4
ひとこと要約

本稿では、深層ニューラルネットワークと微分可能で時間に依存する最短経路(TDSP)ソルバーを組み合わせたハイブリッドアーキテクチャであるNeuro-Algorithmic Policies(NAP)を提案する。このアーキテクチャにより、強化学習における迅速な組合せ的一般化が可能になる。ブラックボックス微分によるエンドツーエンド学習により、従来の状態アーキテクチャと比較して、順応的でない環境変化に対する強力なゼロショット一般化が達成され、専門家の示範データが数個のオーダーもしくは1000分の1程度のわずかな数で実現される。

ABSTRACT

Although model-based and model-free approaches to learning the control of systems have achieved impressive results on standard benchmarks, generalization to task variations is still lacking. Recent results suggest that generalization for standard architectures improves only after obtaining exhaustive amounts of data. We give evidence that generalization capabilities are in many cases bottlenecked by the inability to generalize on the combinatorial aspects of the problem. Furthermore, we show that for a certain subclass of the MDP framework, this can be alleviated by neuro-algorithmic architectures. Many control problems require long-term planning that is hard to solve generically with neural networks alone. We introduce a neuro-algorithmic policy architecture consisting of a neural network and an embedded time-dependent shortest path solver. These policies can be trained end-to-end by blackbox differentiation. We show that this type of architecture generalizes well to unseen variations in the environment already after seeing a few examples.

研究の動機と目的

  • 未知の環境変化に直面した際の標準的な深層強化学習および模倣学習手法の一般化性能の低さを解決すること。
  • 最短経路ソルバーのような組合せ的アルゴリズムをニューラルポリシーに埋め込むことで、低データ環境下での一般化性能が向上するかどうかを調査すること。
  • 神経的アルゴリズム的アーキテクチャが、組合せ的複雑性を効率的なアルゴリズムに移管することで、強力な一般化を達成できることを示すこと。
  • 動的で画像ベースの制御環境における微分可能プランナの有効性を評価すること。

提案手法

  • 本手法は、入力観測から時間的に変化するグラフを生成する深層ニューラルネットワークを用いる。ここでエッジの重みは時間に依存するコストを表す。
  • 微分可能な時間に依存する最短経路(TDSP)ソルバーが、潜在的グラフ上の最適な経路を計算し、ブラックボックス微分により勾配を逆伝播する。
  • 全アーキテクチャは、少数の専門家の示範経路から模倣学習によりエンドツーエンドで訓練される。
  • 潜在的グラフ構造は、既知のトポロジカルグリッドと固定された行動を仮定しており、ソルバーはネットワークから導出される変化するコストに基づいて動作する。
  • 本手法は、最短経路アルゴリズムの組合せ的インダクティブバイアスを活用し、明示的なモデル学習を必要とせずに一般化性能を向上させる。
  • 本手法は静的および動的環境の両方、画像ベースのゲーム環境にも適用可能である。

実験結果

リサーチクエスチョン

  • RQ1微分可能な最短経路ソルバーをニューラルポリシーに埋め込むことで、未知の環境変化に対する一般化性能が向上するか?
  • RQ2低データ環境下で、神経的アルゴリズム的ポリシーの性能は、標準的な模倣学習ベースラインと比べてどうなるか?
  • RQ3組合せ的プランナの使用が、一般化設定においてより最適(短い)経路を達成するか?
  • RQ4動的環境における計画ホライズンの長さに、本手法の性能はどれほど感応するか?
  • RQ5画像ベースの制御タスクにおいて、神経的アルゴリズム的ポリシーは極めて少ない専門家の示範データで効果的に一般化できるか?

主な発見

  • NAPは100レベルの学習のみでマップ環境で80%近い成功率を達成したが、PPO や DrAC ですら1,000レベル学習しても到達できなかった性能であった。
  • NAPが1,000レベルで学習した結果は、PPOが200,000レベルで学習した結果と同等の性能を示した。
  • Crash Jewel Hunt 5×5環境では、NAPはたった30本の専門家の示範データで1,000テストレベルのうち33%を解けたが、行動コーディングベースラインは5%未満にとどまった。
  • NAPは、解けたレベルに対してもPPO や DrAC∗ よりもはるかに短い経路長を示しており、経路の最適性が優れていることが示された。
  • 長い計画ホライズンは動的環境での性能向上に寄与したが、マップのような静的環境では期待通りに効果がなかった。
  • 本手法は極めて少ないデータでも強力な一般化を示しており、プランナからの組合せ的インダクティブバイアスが低データ一般化の鍵であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。