Skip to main content
QUICK REVIEW

[論文レビュー] Learning RoboCup-Keepaway with Kernels

Tobias Jung, Daniel Polani|arXiv (Cornell University)|Jan 31, 2012
Reinforcement Learning in Robotics参考文献 22被引用数 3
ひとこと要約

本論文は、部分回帰子近似を用いた正則化ネットワークを用いたカーネルベースの強化学習手法を提案し、高次元で確率的な3対2 RoboCup-Keepaway問題を解く。効率的な再帰的最小二乗方策反復と教師付き基底関数選択を採用することで、タイルコーディングを上回る性能を達成するとともに、動的でデータ駆動の基底関数の組み込みによりリアルタイム学習を可能にする。

ABSTRACT

We apply kernel-based methods to solve the difficult reinforcement learning problem of 3vs2 keepaway in RoboCup simulated soccer. Key challenges in keepaway are the high-dimensionality of the state space (rendering conventional discretization-based function approximation like tilecoding infeasible), the stochasticity due to noise and multiple learning agents needing to cooperate (meaning that the exact dynamics of the environment are unknown) and real-time learning (meaning that an efficient online implementation is required). We employ the general framework of approximate policy iteration with least-squares-based policy evaluation. As underlying function approximator we consider the family of regularization networks with subset of regressors approximation. The core of our proposed solution is an efficient recursive implementation with automatic supervised selection of relevant basis functions. Simulation results indicate that the behavior learned through our approach clearly outperforms the best results obtained earlier with tilecoding by Stone et al. (2005).

研究の動機と目的

  • 高次元状態空間とリアルタイム学習の課題に取り組むこと。タイルコーディングではパラメータ数の指数的増加のため、RoboCup-Keepawayでは失敗する。
  • 未知の確率的ダイナミクスを有するマルチエージェント環境において、モデルフリーでオンラインの強化学習手法を開発すること。
  • 教師付き基準を用いて関連する基底関数のみを動的に選択することで、効率的なリアルタイム学習を可能にすること。
  • 3対2 Keepawayタスクにおいて、学習効率および最終的なパフォーマンスの面で、従来のタイルコーディングに基づく手法を上回ること。

提案手法

  • 高次元状態空間における価値関数推定に、正則化ネットワークを関数近似器として用いた最小二乗方策反復(LSPE(λ))を採用する。
  • 部分回帰子法を用いて、動的に選択された基底関数の縮小セットを用いてカーネル関数を近似する。
  • 学習コストの低減に寄与する程度に基づいて基底関数を優先順位付けする、グリーディでオンラインの基底関数選択戦略を採用する。この戦略は、単なる近似誤差ではなく、学習コストへの寄与度に基づく。
  • 各ステップの計算量が選択された基底関数の数にのみ依存する、効率的なオンライン学習のための再帰的更新メカニズムを導入する。
  • 各候補基底関数の影響が元の学習コストの低減に与える寄与度を評価する、教師付き選択基準を組み込む。
  • 再帰的行列逆行列およびベクトル更新の公式を用いて、オンライン学習および推論中に計算効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1動的基底関数選択を用いたカーネルベースの関数近似は、RoboCup-Keepawayのような高次元で確率的な強化学習タスクにおいて、従来のタイルコーディングを上回ることができるか?
  • RQ2教師付き基底関数選択基準は、基底関数の数を削減しつつ、学習パフォーマンスを維持または向上させることができるか?
  • RQ3再帰的で最小二乗に基づく方策反復フレームワークは、100ms/アクションの環境において、リアルタイムオンライン学習に十分な効率性を備えているか?
  • RQ4状態変数の独立性に関する簡略化仮定を一切行わずに、13次元の状態ベクトルをそのまま使用することで、先行研究よりも優れたパフォーマンスが得られるか?
  • RQ5グリッドベースの手法と比較して、提案手法は訪問されない状態空間の領域におけるパラメータの無駄遣いをどの程度削減できるか?

主な発見

  • 提案されたカーネルベースの手法は、Stoneら(2005)のタイルコーディング手法を著しく上回り、3対2 Keepawayタスクにおいて平均エピソード長が延びた。
  • 教師付き基底関数選択基準の導入により、必要な基底関数の数が削減され、計算がより効率的になり、1ステップあたりの計算量も低減された。
  • 再帰的実装により、100ms/アクションのサイクルを満たすリアルタイム学習が可能になった。
  • 状態変数の独立性に関する簡略化仮定に依存せず、高次元状態空間(13次元)を効果的に処理できた。
  • 部分回帰子近似は、フルカーネル法と比較して計算負荷を著しく低減しながらも、高い精度を維持した。
  • 学習パフォーマンスは環境の確率的特性およびマルチエージェント協力ダイナミクスに対して頑健であり、複雑で未知の環境における一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。