Skip to main content
QUICK REVIEW

[論文レビュー] Safe Reinforcement Learning of Control-Affine Systems with Vertex Networks

Liyuan Zheng, Yuanyuan Shi|arXiv (Cornell University)|Mar 20, 2020
Extremum Seeking Control Systems被引用数 15
ひとこと要約

この論文では、制御アフィン系における安全性を保証する新しいニューラルネットワークアーキテクチャであるボトムネットワーク(VNs)を提案する。VNsは、安全領域の頂点の凸結合として事前に計算された頂点を用いて、状態と制御入力の制約をポリシー・ネットワークに直接埋め込むことで、学習時および推論時における制約の満たし方を保証する。行動を安全領域の頂点の凸結合として構築することにより、オンライン最適化を必要とせず、制約を満たす行動を生成する。ベンチマークタスクにおいて、ペナルティベースの安全性を採用する標準的な強化学習よりも優れた性能を示す。

ABSTRACT

This paper focuses on finding reinforcement learning policies for control systems with hard state and action constraints. Despite its success in many domains, reinforcement learning is challenging to apply to problems with hard constraints, especially if both the state variables and actions are constrained. Previous works seeking to ensure constraint satisfaction, or safety, have focused on adding a projection step to a learned policy. Yet, this approach requires solving an optimization problem at every policy execution step, which can lead to significant computational costs. To tackle this problem, this paper proposes a new approach, termed Vertex Networks (VNs), with guarantees on safety during exploration and on learned control policies by incorporating the safety constraints into the policy network architecture. Leveraging the geometric property that all points within a convex set can be represented as the convex combination of its vertices, the proposed algorithm first learns the convex combination weights and then uses these weights along with the pre-calculated vertices to output an action. The output action is guaranteed to be safe by construction. Numerical examples illustrate that the proposed VN algorithm outperforms vanilla reinforcement learning in a variety of benchmark control tasks.

研究の動機と目的

  • 制御系における硬い状態および制御入力制約下での強化学習ポリシーの学習という課題に取り組む。
  • 各推論ステップで最適化問題を解く必要があるオンラインプロジェクションベースの安全性手法の計算負荷を軽減する。
  • 学習および実装の各ステップで制約を満たすことを保証する安全な探索フレームワークを構築する。期待値でのみ満たされるのではなく、常に満たされる。
  • 凸集合の幾何的性質を活用して、安全性制約を内蔵的に尊重するニューラルネットワークアーキテクチャを設計する。
  • 厳格な安全性要件を有する連続制御ベンチマークにおいて、提案手法の有効性を実証する。

提案手法

  • 安全領域(凸多面体)をその頂点の凸包として表現し、凸集合内の任意の点がその頂点の凸結合として表現可能であるという事実を活用する。
  • 各時刻における安全領域の頂点の凸結合係数(重み)を出力するポリシー・ネットワークを設計する。
  • 学習された重みと事前に計算された頂点を用いて、最終的な行動を凸結合として計算し、構造的に安全領域内に位置することを保証する。
  • 標準的なポリシー最適化フレームワーク(例:DDPG や PPO)にボトムネットワークを統合し、安全性が保証されるエンドツーエンドの学習を可能にする。
  • 各時刻において、安全状態領域とアクチュエータ制約集合の交差領域の頂点をオンラインで計算し、変化する制約に適応する。
  • 安全性をネットワークアーキテクチャに埋め込むことで、推論時のプロジェクションステップの必要性を排除し、オンライン最適化を回避する。

実験結果

リサーチクエスチョン

  • RQ1強化学習における探索および実装の両段階で制約を満たすことを保証できるニューラルネットワークアーキテクチャを設計できるか?
  • RQ2安全性制約をポリシー・ネットワークアーキテクチャに直接埋め込む方法は、ペナルティベースまたはプロジェクションベースの手法と比較して、安全性およびサンプル効率の観点でどのように異なるか?
  • RQ3硬い制約を有する高次元制御タスクにおいて、頂点ベースの凸結合による行動生成が性能に与える影響は何か?
  • RQ4環境のダイナミクスが複雑であったり、制約が時間的に変化しても、提案手法は安全性を維持できるか?
  • RQ5特に頂点数が増加する場合に、高次元状態および制御入力空間を有するシステムへのスケーリングはどの程度可能か?

主な発見

  • ボトムネットワーク(VNs)は、学習および推論の両段階で完全な制約満たしを達成し、あらゆるベンチマークタスクで制約違反が観測されなかった。
  • ばね-質量系では、ペナルティベースの安全性を採用する標準的なポリシー・ネットワーク(PN)と比較して、VNsは初期学習段階で高い累積報酬を達成し、全期間にわたり安全性を維持した。
  • ホバーカートタスクでは、厳密な傾き角制約($\bar{\theta} = 0.01$)のもとで、VNsは安全にターゲットへ到達したが、PNポリシーは報酬関数にペナルティが設けられていても制約に違反し、大きな傾き角に達した。
  • 軌道可視化の結果、VNsポリシーは滑らかで安全な運動を生成する一方、PNポリシーは長期間の訓練後でさえも安全でない行動を示した。
  • 本手法はさまざまな制約バウンダリーに対して頑健であり、厳しい制限下でも一貫して安全性を維持した。
  • VNsの計算コストは、推論時に最適化問題を解く必要がないため、プロジェクションベース手法よりも顕著に低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。