Skip to main content
QUICK REVIEW

[論文レビュー] Graph neural induction of value iteration

Andreea Deac, Pierre‐Luc Bacon|arXiv (Cornell University)|Sep 26, 2020
Reinforcement Learning in Robotics参考文献 17被引用数 6
ひとこと要約

本稿では、中間的価値反復(VI)状態に対する段階的監視を用いて、任意のマルコフ決定過程(MDP)構造上で価値反復(VI)を直接学習するグラフニューラルネットワーク(GNN)を提案する。GNNは、サイズ、トポロジー、スパarsityレベルが異なる分布外のMDPに対しても強力なゼロショット一般化を達成し、GNNが高精度かつ高い方策回復を実現するように、VIアルゴリズムをきめ細かく誘導できることを示している。

ABSTRACT

Many reinforcement learning tasks can benefit from explicit planning based on an internal model of the environment. Previously, such planning components have been incorporated through a neural network that partially aligns with the computational graph of value iteration. Such network have so far been focused on restrictive environments (e.g. grid-worlds), and modelled the planning procedure only indirectly. We relax these constraints, proposing a graph neural network (GNN) that executes the value iteration (VI) algorithm, across arbitrary environment models, with direct supervision on the intermediate steps of VI. The results indicate that GNNs are able to model value iteration accurately, recovering favourable metrics and policies across a variety of out-of-distribution tests. This suggests that GNN executors with strong supervision are a viable component within deep reinforcement learning systems.

研究の動機と目的

  • 最終的リターンのみに依存する訓練ではなく、中間ステップにおける明示的監視を用いて、価値反復アルゴリズムを直接学習するニューラルネットワークを開発すること。
  • グリッドワールドにとどまらない、状態空間と行動空間が可変な任意のMDPへ、グラフニューラルネットワークを用いて価値反復計画を拡張すること。
  • GNNが価値反復のアルゴリズム的構造を高い忠実度で学習し、未観測のMDPトポロジーへ一般化できるかを調査すること。
  • MDPモデル推論と微分可能な価値反復実行を統合することで、計画と方策学習の統合を可能にすること。

提案手法

  • 本手法は、グラフ畳み込み演算を用いて価値反復更新ルールを直接エミュレートするメッセージパッシングGNN(MPNN)アーキテクチャを採用する。
  • グラフ内の各ノード(状態)は、遷移確率と報酬に基づく隣接ノードのメッセージの集約を通じて、価値推定値を更新する。
  • メッセージ関数は、各行動と後続状態の寄与を計算し、割合因子γと遷移確率p(s′|s,a)の積をモデル化するための学習可能なMLPを用いる。
  • 更新ルールは、ベルマン更新を実装するGNN層として実装される:v^(t+1)(s) = max_a [r(s,a) + γ Σ p(s′|s,a) v^(t)(s′)]。
  • GNNは、各VI反復における中間的価値推定値に対して直接監視を施し、平均二乗誤差(MSE)損失を用いて訓練される。
  • モデルは、Erdős-Rényi、スケールフリーフラット、スパースグラフを含む多様なMDPで評価され、未学習のグラフ分布および決定的迷路へのゼロショット一般化が検証された。

実験結果

リサーチクエスチョン

  • RQ1中間ステップの監視を用いて、最終的リターンのみに依存する訓練ではなく、価値反復アルゴリズムを直接シミュレートできるGNNを訓練できるか?
  • RQ2学習時に見られなかった状態数や行動数を持つMDPに対して、GNNの一般化性能はどの程度か?
  • RQ3スケールフリーフラット、スターフラット、ツリー構造などの異なるグラフ構造を持つMDPに対して、GNNは高い方策正確性を維持できるか?
  • RQ4例えば標準的な8×8迷路のようなスパースまたはより決定的であるMDPでは、性能がどの程度低下するか?
  • RQ5トラジェクトリからMDPモデル学習を組み合わせることで、モデルフリーでエンドツーエンド微分可能な計画システムを構築できるか?

主な発見

  • MPNN-Sumモデルは、100状態・20行動のMDPにおいて、分布外テスト時でも99.3%の高精度な方策を達成した。
  • スケールフリーフラット(Barabási-Albert)、スターフラット、ツリー構造など、未学習のMDPグラフ分布に対しても、一貫して90%以上の高い方策正確性を示した。
  • 完全に決定的な8×8迷路では、方策正確性が70%に低下した。これは、学習データに十分に表現されていなかったスパースかつ決定的グラフでは性能劣化が生じることを示している。
  • アテンションベースのメッセージ集約(Attn-Sum)を用いることでMSEは低下したが、方策正確性が著しく低下した。これは、アテンションがVIにおける価値順序の保持に不適切である可能性を示唆している。
  • 2層のメッセージ関数(MPNN-2-Sum)は、1層モデルと同等の性能を示した。これは、VI更新をモデル化するのに単純なMLPで十分であることを示している。
  • GNNはMSEが低く(例:|S|=100、|A|=20のとき5.123)、反復ごとに滑らかに収束し、VIダイナミクスの安定した学習を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。