Skip to main content
QUICK REVIEW

[論文レビュー] Symbolic Regression for Constructing Analytic Models in Reinforcement Learning

Erik Derner, Jiřı́ Kubalı́k|arXiv (Cornell University)|Mar 27, 2019
Reinforcement Learning in Robotics参考文献 37被引用数 4
ひとこと要約

本稿では、限られたデータから自動的にコン pact で解釈可能な解析的モデルを構築するために、記号的回帰(SR)を用いる手法を提案する。状態空間およびNARX型の入出力モデルにSRを適用することで、深層ニューラルネットワークや局所線形回帰を上回る優れた性能を達成し、わずか100件のデータサンプルで実機の振り子のスイングアップ制御に成功した。

ABSTRACT

Reinforcement learning (RL) is a widely used approach for controlling systems with unknown or time-varying dynamics. Even though RL does not require a model of the system, it is known to be faster and safer when using models learned online. We propose to employ symbolic regression (SR) to construct parsimonious process models described by analytic equations for real-time RL control. We have tested our method with two different state-of-the-art SR algorithms which automatically search for equations that fit the measured data. In addition to the standard problem formulation in the state-space domain, we show how the method can also be applied to input-output models of the NARX (nonlinear autoregressive with exogenous input) type. We present the approach on three simulated examples with up to 14-dimensional state space: an inverted pendulum, a mobile robot, and a biped walking robot. A comparison with deep neural networks and local linear regression shows that SR in most cases outperforms these commonly used alternative methods. We demonstrate on a real pendulum system that the analytic model found enables RL to successfully perform the swing-up task, based on a model constructed from only 100 data samples.

研究の動機と目的

  • 限られたデータから解釈可能な解析的プロセスモデルを構築することで、強化学習におけるデータ効率性と安全性を向上させること。
  • 未知または時間変動する挙動を示すシステムにおける複雑な非線形ダイナミクスのモデリングという課題に取り組むこと。
  • 計算的に効率的で解釈可能なコンパクトな閉形式方程式を生成することで、リアルタイムRL制御を可能にすること。
  • 精度、データ効率性、耐障害性の観点から、記号的回帰と深層ニューラルネットワークおよび局所線形回帰を比較すること。
  • 高次元の状態空間を含む、シミュレーションおよび実世界のロボットシステムにおいて、この手法を検証すること。

提案手法

  • 測定されたシステムデータに最も適合する解析的式を探索するために、2つの最先端の記号的回帰アルゴリズムを採用すること。
  • 動的挙動を捉えるために、状態空間およびNARX(非線形自己回帰型で外部入力を伴う)フレームワークの両方でシステムモデリング問題を定式化すること。
  • データ駆動型の式発見を用いてシステムダイナミクスを表現し、単純性と解釈可能性を確保すること。
  • 記号的モデルを用いて強化学習エージェントを訓練し、スイングアップや安定化といった制御タスクを実行すること。
  • 予測精度とRL制御の成功度を、異なるモデルタイプ間で比較することで、モデルの性能を評価すること。
  • 14次元の状態空間を含む、倒立振子、移動ロボット、二足歩行ロボットなど、最大14次元の状態空間を持つシステムにこの手法を適用すること。

実験結果

リサーチクエスチョン

  • RQ1記号的回帰は、リアルタイム強化学習に使用するため、限られたデータから正確でコンパクトな解析的モデルを生成できるか?
  • RQ2記号的回帰は、非線形システムダイナミクスのモデリングにおいて、深層ニューラルネットワークや局所線形回帰と比べてどのように異なるか?
  • RQ3たった100件のデータサンプルから得た記号的モデルは、実世界のロボットシステムにおける成功したRL制御を可能にするか?
  • RQ4NARX定式化は、標準的な状態空間モデリングと比較して、モデルの精度と制御性能を向上させるか?
  • RQ5解釈可能な解析的モデルは、RLベースの制御におけるデータ効率性と安全性をどの程度向上させるか?

主な発見

  • 記号的回帰は、すべてのシミュレーション例において、深層ニューラルネットワークや局所線形回帰を上回るモデル精度を一貫して達成した。
  • 本手法により、わずか100件のデータサンプルで解析的モデルを構築し、実機の振り子のスイングアップ制御に成功した。
  • 得られたモデルは単純さと解釈可能性の両方を備えており、ブラックボックス型の深層学習モデルと比べて顕著な利点を示した。
  • 本手法は高次元システムに対しても有効であり、14次元の二足歩行ロボットにおいてもスケーラビリティを示した。
  • NARX定式化は、入出力モデリングの代替手段として有効であり、特定の動的状態域においてモデル適合性を向上させた。
  • 記号的モデルの使用により、エンドツーエンドのニューラルネットワークで学習されたモデルと比較して、より高速かつ安定したRL学習が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。