Skip to main content
QUICK REVIEW

[論文レビュー] Non-Stochastic Control with Bandit Feedback

Paula Gradu, John Hallman|arXiv (Cornell University)|Aug 12, 2020
Advanced Bandit Algorithms Research参考文献 34被引用数 4
ひとこと要約

本稿では、スカラー損失値しか観測できないバンドイットフィードバックの下で、非確率的制御における線形力学的システムに対する最初の効率的なサブ線形レグレットアルゴリズムを提示する。時間依存の損失関数を扱える、記憶を考慮した新規なバンドイット凸最適化手法を導入することで、既知および未知の両方のシステムにおいて、Õ(poly(自然パラメータ)T^{3/4}) のレグレットを達成する。

ABSTRACT

We study the problem of controlling a linear dynamical system with adversarial perturbations where the only feedback available to the controller is the scalar loss, and the loss function itself is unknown. For this problem, with either a known or unknown system, we give an efficient sublinear regret algorithm. The main algorithmic difficulty is the dependence of the loss on past controls. To overcome this issue, we propose an efficient algorithm for the general setting of bandit convex optimization for loss functions with memory, which may be of independent interest.

研究の動機と目的

  • スカラーのバンドイットフィードバックでのみ観測可能な状況下で、敵対的摂動と未知の損失関数を伴う線形力学的システムの制御という課題に取り組む。
  • 過去の制御入力に依存する時間依存の損失関数の困難さ、これはゼロオーダーフィードバック設定における勾配推定を複雑にする。
  • システムの動的特性が未知であっても、非確率的制御フレームワークでサブ線形レグレットを達成できる、効率的なアルゴリズムを開発する。
  • 既存の凸緩和法およびシステム同定技術をバンドイットフィードバック設定に拡張し、実世界の制御応用における実用的導入を可能にする。
  • 多様な損失関数およびノイズモデル、特に相関のあるおよびi.i.d.でない摂動に対して、提案手法の有効性を示す。

提案手法

  • 過去の状態および制御入力に依存する損失関数を扱える、記憶を有する新しいバンドイット凸最適化アルゴリズムを提案する。
  • 時間依存性を解消するための人工的な遅延機構を導入し、バンドイットフィードバック設定における不偏な勾配推定を可能にする。
  • [4]の凸緩和技術と[16, 30]の非確率的システム同定技術を組み合わせ、リアルタイムでのシステム動的特性および摂動の推定を実現する。
  • 摂動に基づく手法による推定勾配を用いた勾配ベース最適化を、損失関数の記憶的要因を考慮して適応させる。
  • バンドイット最適化フレームワークを、過去の摂動を組み込むことで線形力学的制御器(LDC)を一般化する、摂動-作用制御器(DAC)に適用する。
  • 二段階の学習プロセスを実装する:まず、オンライン推定(アルゴリズム3または線形回帰を用いて)でシステム動的特性を同定し、その後、推定モデルを用いて制御方策を最適化する。

実験結果

リサーチクエスチョン

  • RQ1スカラーのバンドイットフィードバックでのみ観測可能な状況下で、非確率的制御における線形システムのサブ線形レグレットを達成できるか?
  • RQ2損失関数が過去の制御行動に依存する(すなわち記憶を持つ)バンドイット設定において、勾配推定をどのように効果的に実現できるか?
  • RQ3敵対的摂動および未知のシステム動的特性下で、提案アルゴリズムの性能はいかがなものか?
  • RQ4非i.i.d.ノイズ環境下で、古典的LQRおよび勾配ベースのポリシー手法(例:GPC)と比較して、アルゴリズムの性能はどの程度か?
  • RQ5システム動的特性が事前に分かっておらず、オンラインで推定されなければならない状況でも、レグレットバウンドを維持できるか?

主な発見

  • 提案アルゴリズムは、敵対的摂動およびバンドイットフィードバック下で、既知および未知の線形力学的システムの両方において、Õ(poly(自然パラメータ)T^{3/4}) のレグレットを達成する。
  • LQRは相関のあるノイズ(例:正弦波およびランダムウォーク摂動)の下で劣化するが、本手法はそのような状況でLQRを上回る性能を示す。
  • 学習率を徐々に減衰させる場合、i.i.d.ガウスノイズ環境下でアルゴリズムはLQR解に収束し、良好な設定下での一貫性を裏付ける。
  • 記憶を考慮したバンドイット凸最適化フレームワークにより、ゼロオーダーフィードバック下でも、時間依存の損失依存性の課題を克服し、効果的な学習が可能になる。
  • アルゴリズム3および線形回帰の両方のシステム同定法が、未知動的特性の状況下でも安定した学習を可能にするが、実験ではアルゴリズム3の性能が優れている。
  • L2、L1、L∞、およびReLUを含む多様な損失関数において、アルゴリズムは良好な性能を維持し、滑らかでないおよび二次形式でないコストに対してもロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。