Skip to main content
QUICK REVIEW

[論文レビュー] Robust exploration in linear quadratic reinforcement learning

Jack Umenberger, Mina Ferizbegovic|arXiv (Cornell University)|Jun 4, 2019
Reinforcement Learning in Robotics参考文献 36被引用数 4
ひとこと要約

本稿では、モデルの不確実性下での最悪ケースコストを最小化することを目的とした、凸最適化に基づくロバスト強化学習手法を、線形二次制御問題に提案する。報酬の最大化と標的探索のバランスを取ることで、最も重要なパラメータにおける不確実性を動的に低減し、シミュレーションおよびハードウェアインザループ実験の両方でベースライン手法を上回るロバスト性と性能を達成する。

ABSTRACT

This paper concerns the problem of learning control policies for an unknown linear dynamical system to minimize a quadratic cost function. We present a method, based on convex optimization, that accomplishes this task robustly: i.e., we minimize the worst-case cost, accounting for system uncertainty given the observed data. The method balances exploitation and exploration, exciting the system in such a way so as to reduce uncertainty in the model parameters to which the worst-case cost is most sensitive. Numerical simulations and application to a hardware-in-the-loop servo-mechanism demonstrate the approach, with appreciable performance and robustness gains over alternative methods observed in both.

研究の動機と目的

  • 未知の線形力学的システムと二次コスト関数を有する制御方策の学習における、探索と活用のトレードオフを解決すること。
  • 観測データから導かれるモデル不確実性下での最悪ケースコストを最小化することで、ロバストな性能を保証すること。
  • 最悪ケースコストに最も影響を与えるパラメータにのみ不確実性を低減するように、標的化された探索戦略を設計すること。
  • 計算的に実行可能で、凸近似可能なロバストLQRのための近似手法を開発すること。
  • 数値的シミュレーションおよびハードウェアインザループ実験を通じて、本手法の有効性を検証し、優れた性能とロバスト性を示すこと。

提案手法

  • システムのパラメータ推定誤差のスペクトルノルムに関する高確率的バウンドを導出し、ロバスト制御のための不確実性評価を可能にする。
  • パラメータ不確実性下での無限時間LQR問題の最悪ケースに近い解を求めるための凸半定値計画(SDP)近似を提案する。
  • 不確実性バウンドと凸LQR近似を統合し、探索と活用のバランスを取るロバスト強化学習(RRL)フレームワークを構築する。
  • 将来の最悪ケースコスト感度に基づいて、ポリシー更新をガイドするための見通し時間の長さを h=10(シミュレーション)または h=5(ハードウェア)に設定する。
  • 不確実性を最も重要なモデルパラメータにのみ低減するように、探索分散を動的に最適化し、任意またはランダムなプローブを回避する。
  • 名目ロバストポリシーをベースラインとして採用し、理論的最悪ケースコストに一致するように分散を増加させるグリーディ探索ポリシーと比較する。

実験結果

リサーチクエスチョン

  • RQ1最悪ケース制御性能に最も影響を与えるパラメータの不確実性を低減するために、探索をどのように体系的かつ標的化できるか?
  • RQ2不確実性を伴う線形システムにおける最悪ケースLQR問題を、計算的に実行可能な方法で凸最適化フレームワークで近似できるか?
  • RQ3標的探索と最悪ケースコスト最小化を組み合わせたロバスト強化学習は、純粋に活用的またはランダムに探索するポリシーを上回る性能を発揮するか?
  • RQ4本手法は、実世界のハードウェアインザループ制御シナリオにおいて、どの程度ロバスト性と性能を向上させるか?
  • RQ5全体の不確実性低減量は少ないものの、本手法による情報量の増加(不確実性低減)は、グリーディ探索と比較してどのように異なるか?

主な発見

  • 数値的シミュレーションにおいて、本手法であるRRLは、名目(純粋に活用的)およびグリーディ(ランダム探索)ポリシーの両方を下回る低い総コストを達成した。
  • 初期エポックでは、探索が不足しているため名目ポリシーが優れていたが、後続の段階でRRLがそれを上回り、効果的な長期的学習を示した。
  • RRLはグリーディ探索よりも戦略的に不確実性を低減しており、情報量の増加は名目よりは高いがグリーディよりは低いが、コストでは両者を上回った。
  • ハードウェアインザループ実験では、RRLは総コストおよびエポックあたりのコストの両面で、両ベースライン手法を著しく上回った。
  • 理論的最悪ケース動作に基づいてモデル不確実性を更新しても、本手法はロバストな性能を発揮した。これは、最悪ケース最適化という目的を達成していることを裏付けた。
  • 情報量指標(1/λ_max(D_i^{-1})) は、RRLがコスト低減と直接関連するように不確実性を低減していることを示しており、標的学習の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。