Skip to main content
QUICK REVIEW

[論文レビュー] Representation Learning on Graphs: A Reinforcement Learning Application

Sephora Madjiheurem, Laura Toni|arXiv (Cornell University)|Jan 16, 2019
Reinforcement Learning in Robotics参考文献 15被引用数 5
ひとこと要約

本稿では、従来のプロト・バリュー関数(PVFs)の代わりに、学習されたグラフ表現モデル—具体的にはnode2vecと変分グラフオートエンコーダ(VAE)—を用いて、強化学習における線形価値関数近似のための一般化された表現方策反復(RPI)フレームワークを提案する。これらの学習された特徴量は、構造的幾何学的性質と局所的グラフ特性を捉えており、低次元状態空間においてPVFsを著しく上回る性能を発揮することが示された。特に、構造的同等性を重視することで、node2vecは優れた性能を発揮した。

ABSTRACT

In this work, we study value function approximation in reinforcement learning (RL) problems with high dimensional state or action spaces via a generalized version of representation policy iteration (RPI). We consider the limitations of proto-value functions (PVFs) at accurately approximating the value function in low dimensions and we highlight the importance of features learning for an improved low-dimensional value function approximation. Then, we adopt different representation learning algorithm on graphs to learn the basis functions that best represent the value function. We empirically show that node2vec, an algorithm for scalable feature learning in networks, and the Variational Graph Auto-Encoder constantly outperform the commonly used smooth proto-value functions in low-dimensional feature space.

研究の動機と目的

  • 状態空間の幾何構造が不規則または不適切にモデル化されている場合、従来のプロト・バリュー関数(PVFs)が価値関数を近似する際の限界を解消すること。
  • グラフ上での表現学習が、強化学習における線形価値関数近似のためのより優れた基底関数をもたらすかどうかを調査すること。
  • 低次元特徴空間における標準的なPVFsと比較して、現代のグラフ埋め込み手法—特にnode2vecと変分グラフオートエンコーダ(VAE)—の性能を評価すること。
  • MDPに由来するグラフの幾何構造を最も効果的に保持するグラフ表現学習戦略が、価値関数近似をどのように改善するかを特定すること。

提案手法

  • 従来のRPIで用いられる固定されたラプラシアン固有ベクトルに代えて、任意の基底関数を許容するように、表現方策反復(RPI)アルゴリズムを一般化する。
  • 収集されたMDPの遷移軌道から状態遷移グラフを構築し、ノードは状態を、エッジは遷移確率を表す。
  • ハイパーパramータ p と q を用いてランダムウォーク戦略を制御することで、node2vecを用いて局所的およびグローバルなグラフ構造を保持する低次元ノード埋め込みを学習する。
  • 潜在空間の埋め込みから隣接行列を再構成することで、変分グラフオートエンコーダ(VGAE)を訓練し、ノード表現を学習する。
  • 学習された埋め込みを線形価値関数近似における基底関数として用い、予測値関数と真の価値関数との平均二乗誤差を最小化するための最小二乗最適化を実行する。
  • node2vecのハイパーパrameter(p と q)をグリッドサーチを用いて最適化し、価値関数近似に最も適したサンプリング戦略を同定する。

実験結果

リサーチクエスチョン

  • RQ1グラフ上での表現学習は、従来のプロト・バリュー関数と比較して、強化学習における価値関数近似を改善できるか?
  • RQ2特にnode2vecと変分グラフオートエンコーダ(VAE)といった異なるグラフ表現学習手法は、低次元特徴空間における価値関数近似において、どのように性能を発揮するか?
  • RQ3ノード埋め込みのどの特性(例:構造的同等性対同型性)が、効果的な価値関数近似において最も重要か?
  • RQ4ランダムウォークプロセスにおけるサンプリング戦略(特に幅優先探索対深さ優先探索)の違いが、学習された基底関数の性能に与える影響は何か?

主な発見

  • 構造的同等性を重視する p=1 かつ q=4 のnode2vecは、他のすべてのパラメータ設定およびPVFsを著しく上回り、価値関数近似の精度を顕著に向上させた。
  • node2vecの埋め込みを用いることで、特に低次元特徴空間において、PVFsよりも価値関数近似の平均二乗誤差が顕著に低減された。
  • VAEはより多くの訓練を要するにもかかわらず、node2vecに比べて僅かな性能向上しか得られず、この文脈ではより単純なモデルでも十分に効果的な表現学習が可能であることを示唆している。
  • 学習された特徴量による性能向上は、MDPに由来するグラフのグローバルな構造的幾何学的性質を捉えつつ、局所的近傍性質を保持する埋め込み手法で最も顕著に現れた。
  • グラフが不適切に推定されている場合、PVFsに内在する滑らかさ仮定は実際には成立しないため、データ駆動型の基底関数学習の必要性が裏付けられた。
  • 結果から、同型性よりも構造的同等性を重視する表現学習モデルが、強化学習における価値関数近似に適していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。