Skip to main content
QUICK REVIEW

[論文レビュー] Safe Adaptive Learning-based Control for Constrained Linear Quadratic Regulators with Regret Guarantees

Yingying Li, Subhro Das|arXiv (Cornell University)|Oct 31, 2021
Advanced Control Systems Optimization参考文献 42被引用数 11
ひとこと要約

本稿では、安全保証を伴う、制約付き線形二次調節器(LQR)の多項式時間、シングルトラジェクトリの適応学習ベース制御アルゴリズムを提案する。最小二乗推定、確信度等価とロバストな制約満足、および新規のSafeTransitポリシー更新メカニズムを組み合わせることで、モデルの不確実性下でも実行可能性と制約の満足を保証し、既知の動的特性を持つ最適な安全な線形制御器と比較して、$\tilde{O}(T^{2/3})$ のサブリニアなレグレットを達成する。

ABSTRACT

We study the adaptive control of an unknown linear system with a quadratic cost function subject to safety constraints on both the states and actions. The challenges of this problem arise from the tension among safety, exploration, performance, and computation. To address these challenges, we propose a polynomial-time algorithm that guarantees feasibility and constraint satisfaction with high probability under proper conditions. Our algorithm is implemented on a single trajectory and does not require system restarts. Further, we analyze the regret of our learning algorithm compared to the optimal safe linear controller with known model information. The proposed algorithm can achieve a $ ilde O(T^{2/3})$ regret, where $T$ is the number of stages and $ ilde O(\cdot)$ absorbs some logarithmic terms of $T$.

研究の動機と目的

  • 未知の線形システムにおける状態および入力制約を伴う安全で適応型制御の課題に対処すること。
  • システムの再起動を回避し、高い確率で実行可能性と制約の満足を保証するシングルトラジェクトリのアルゴリズムを開発すること。
  • 既知のモデル基準と比較してレグレットを最小化することで、最適な安全な線形制御器に近いパフォーマンスを達成すること。
  • 時間変動する推定値とモデルの不確実性を伴う状況において、安全なポリシー更新のためのスローバリエーションテクニックを拡張すること。
  • モデルの不確実性下で一般(おそらく非線形な)ポリシーに適用可能なモデル推定誤差の境界を提供すること。

提案手法

  • 単一の軌道からのデータを用いて、逐次的にシステムモデルの推定値を更新するための最小二乗推定(LSE)を用いる。
  • モデルの不確実性に対処し、制約の遵守を保証するために、確信度等価とロバストな制約満足を適用する。
  • スローバリエーション技術を不確実なモデルに拡張することで、安全なポリシー更新を可能にするSafeTransitアルゴリズムを導入する。
  • 推定誤差とレグレット誤差をバウンディングするために、時間平均化とマルティンググールベースの解析を用いる。
  • 推定誤差とポリシー誤差の成分にレグレットを再帰的に分解し、濃度不等式を活用する。
  • 線形ポリシーに限られていた既存の結果を一般化し、非線形ポリシーに対しても有効な一般的なモデル推定誤差境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1モデルの不確実性下でも安全で制約を満たすシングルトラジェクトリの適応型制御アルゴリズムを設計可能か?
  • RQ2制約付きLQRの適応型制御において、探索、安全性、パフォーマンスの間の根本的トレードオフは何か?
  • RQ3既知のモデル情報を持つ最適な安全な線形制御器と比較して、$\tilde{O}(T^{2/3})$オーダーのレグレット境界を達成可能か?
  • RQ4モデル推定値が時間変動し不確実な状況下で、どのように安全なポリシー更新を保証できるか?
  • RQ5モデルの不確実性下で非線形ポリシーに適用可能な一般的なモデル推定誤差境界は何か?

主な発見

  • 適切な条件下で、システムの再起動を要せず、高い確率で実行可能性と制約の満足を保証する。
  • 既知のモデル情報を持つ最適な安全な線形制御器と比較して、$\tilde{O}(T^{2/3})$ のレグレット境界を達成する。
  • Mayneら(2005年)のRMPCポリシーと比較しても、同様のレグレット境界が成立し、ロバスト制御ベンチマークと比較して優れたパフォーマンスを示す。
  • 導出されたモデル推定誤差境界は、一般およびおそらく非線形なポリシーに適用可能であり、従来の線形ポリシーに限られた結果を拡張する。
  • SafeTransitアルゴリズムは、スローバリエーションテクニックを不確実なモデルに成功裏に拡張し、単一の軌道上で安全かつ適応型のポリシー更新を可能にする。
  • 累積的なレグレットと推定誤差をバウンディングするために、マルティンググール濃度不等式と時間平均化技術を活用した解析が行われた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。