Skip to main content
QUICK REVIEW

[論文レビュー] Dual Control with Active Learning using Gaussian Process Regression

Tansu Alpcan|arXiv (Cornell University)|May 11, 2011
Gaussian Processes and Bayesian Inference参考文献 11被引用数 9
ひとこと要約

本稿では、アクティブラーニングを用いたガウス過程回帰を用いて、システム同定と制御を同時に最適化する二重制御フレームワークを提案する。シャノンエントロピーを用いて情報利得を定量化することで、反復的に探索(データ収集)と活用(性能最適化)のバランスを取る制御行動を選択し、最小限の観測でカオス的かつ非線形系の安定制御を達成する。実装例として、30ステップ以内でロジスティック写像および倒立振子系で検証された。

ABSTRACT

In many real world problems, control decisions have to be made with limited information. The controller may have no a priori (or even posteriori) data on the nonlinear system, except from a limited number of points that are obtained over time. This is either due to high cost of observation or the highly non-stationary nature of the system. The resulting conflict between information collection (identification, exploration) and control (optimization, exploitation) necessitates an active learning approach for iteratively selecting the control actions which concurrently provide the data points for system identification. This paper presents a dual control approach where the information acquired at each control step is quantified using the entropy measure from information theory and serves as the training input to a state-of-the-art Gaussian process regression (Bayesian learning) method. The explicit quantification of the information obtained from each data point allows for iterative optimization of both identification and control objectives. The approach developed is illustrated with two examples: control of logistic map as a chaotic system and position control of a cart with inverted pendulum.

研究の動機と目的

  • 最小限の観測、高コストな観測、または非定常な観測が課す課題に対処すること。
  • 動的制御設定において、情報収集(探索)と性能最適化(活用)の間にある本質的矛盾を解消すること。
  • ベイズ学習を用いて、同定と制御の目的を明示的にバランスさせる統合的で反復的な最適化フレームワークを開発すること。
  • 事前知識や豊富なデータが入手できないブラックボックス系に対しても、効果的な制御を可能にすること。
  • 情報理論、機械学習、制御理論を統合的に統合した、多目的な制御戦略を構築すること。

提案手法

  • 本手法は、スパarsな逐次観測から未知の非線形システムダイナミクスをモデル化するためにガウス過程回帰を用いる。
  • 各観測からの情報利得は、事後ガウス過程分布のシャノンエントロピーを用いて定量化され、データの価値を明示的に測定可能となる。
  • 1ステップ先読みの最適化を用いて、制御性能と情報収集の両方をバランスさせる重み付き和の多目的最適化を定式化する。
  • 制御性能の期待値と情報利得の期待値を組み合わせたコスト関数を最適化することで、次の行動を選択する。
  • フレームワークは反復的に実装される:観測 → GPモデルの更新 → 次の行動の最適化。不確実性とノイズは、カーネルおよびノイズ分散パラメータでモデル化される。
  • 本手法は、2つの動的システム(カオス的ロジスティック写像およびキャリブ・インバーテッド・ペンデュラム系)で検証され、固定されたカーネルおよびノイズ分散値が使用された。

実験結果

リサーチクエスチョン

  • RQ1非線形的かつ動的制御設定において、各観測からの情報利得を明示的に定量化する方法は何か?
  • RQ2データが限られる状況下で、探索(情報収集)と活用(制御性能)の最適なトレードオフは何か?
  • RQ3ガウス過程回帰は、制御文脈においてわずかな観測データ点のみで未知のシステムダイナミクスを効果的にモデル化できるか?
  • RQ4エントロピーに基づく情報測定は、リアルタイムで反復的に実行される制御フレームワークにどのように統合できるか?
  • RQ5観測が高コストで非定常な状況下で、カオス的かつ非線形系の制御にどの程度の性能が達成できるか?

主な発見

  • 提案された二重制御アプローチは、わずかな観測のみでロジスティック写像を30ステップ以内に安定化させ、目標値の10%以内の制御を達成した。
  • キャリブ・インバーテッド・ペンデュラム系では、最小限のデータで安定した位置制御を達成し、非線形性と不確実性に対して高いロバストネスを示した。
  • エントロピーを情報測定に用いることで、有効なアクティブラーニングが実現され、各制御行動が情報利得を最大化しつつ制御性能を維持するように選択された。
  • 反復的でフィードバックベースのフレームワークにより、初期段階でのシステム知識の欠如にもかかわらず、継続的なモデルの改善と制御性能の向上が可能となった。
  • エントロピーによる明示的な情報量の定量化により、ブラックボックス制御において探索と活用の原理的トレードオフが実現された。
  • ベイズ学習による同定と制御の目的の共同最適化により、従来手法に比べてデータが限られる環境下で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。