[論文レビュー] Regret Bounds for LQ Adaptive Control Under Database Attacks (Extended Version)
本稿では、データベース攻撃(学習データが保存後・使用前において汚染される)に対処するため、オンライン最小二乗推定における自己修正型信頼集合の調整を提案する。悪意あるデータのインジェクションを考慮したパrameter推定手順の変更により、攻撃下でも$\mathcal{O}((λ\sqrt{N_{ab}})^p\sqrt{T})$のサブリニアなリグレットが達成され、学習データが改ざんされた場合でも頑健な性能を保証する。
This paper is concerned with understanding and countering the effects of database attacks on a learning-based linear quadratic adaptive controller. This attack targets neither sensors nor actuators, but just poisons the learning algorithm and parameter estimator that is part of the regulation scheme. We focus on the adaptive optimal control algorithm introduced by Abbasi-Yadkori and Szepesvari and provide regret analysis in the presence of attacks as well as modifications that mitigate their effects. A core step of this algorithm is the self-regularized on-line least squares estimation, which determines a tight confidence set around the true parameters of the system with high probability. In the absence of malicious data injection, this set provides an appropriate estimate of parameters for the aim of control design. However, in the presence of attack, this confidence set is not reliable anymore. Hence, we first tackle the question of how to adjust the confidence set so that it can compensate for the effect of the poisonous data. Then, we quantify the deleterious effect of this type of attack on the optimality of control policy by bounding regret of the closed-loop system under attack.
研究の動機と目的
- 学習データが保存後・使用前に汚染されるデータベース攻撃が、学習ベースのLQ適応制御器に与える影響を分析すること。
- このような攻撃が、適応制御に用いられる自己正則化オンライン最小二乗推定と信頼集合の信頼性をどのように損なうかを特定すること。
- データ汚染下でも正確なパrameter推定と制御性能を維持できるように、修正された推定手順を開発すること。
- 攻撃下での閉ループシステムに対するリグレットバウンドを確立し、性能劣化と回復度を定量的に評価すること。
- シミュレーションにより、提案手法が真の値に近いパrameter推定を維持し、ナーブな手法とは異なり攻撃下でもサブリニアなリグレットを達成することを示すこと。
提案手法
- データベース内の潜在的なデータ汚染を考慮した、自己正則化オンライン最小二乗推定器を用いた信頼集合の構築を適応させる。
- 悪意あるデータの影響を低減するため、動的に調整される修正された信頼集合を導入し、頑健なパrameter推定を保証する。
- 調整された信頼集合内でのOFU(不確実性の面前での楽観主義)最適化問題を解くために、射影勾配降下法を用いる。
- パrameter推定の収束を保証するため、適応的ステップサイズ$\gamma = \sqrt{0.001 / \mathrm{Tr}(V_t)}$を適用する。
- 本学習フェーズの開始前の初期安定性を向上させるために、単位球からの50回の探索的行動を適用する。
- 実際のデータインジェクションパターンを想定した、マルティングール差分型攻撃モデルをシミュレーションで採用する。
実験結果
リサーチクエスチョン
- RQ1データベースのデータ汚染は、オンラインLQ適応制御器の性能とパrameter推定の信頼性にどのように影響を与えるか?
- RQ2修正された信頼集合の構築は、自己正則化最小二乗推定における汚染データの影響を緩和できるか?
- RQ3修正された推定手順を用いた場合、データベース攻撃下での閉ループシステムに対してどの程度のリグレットバウンドを確立できるか?
- RQ4データ汚染を無視するナーブなアルゴリズムと比較して、提案された自己修正アルゴリズムはパrameter推定とリグレットの観点でどのように異なるか?
- RQ5どのような条件下で、修正されたアルゴリズムは攻撃下でもサブリニアなリグレットを達成するか?
主な発見
- 図2に示すように、標準的な信頼集合に依存するナーブなアルゴリズムは、データ汚染下で正確なパrameter推定を維持できない。
- 図3に示すように、自己修正アルゴリズムは、継続的なデータベース攻撃下でも真のシステムパラメータに近いパrameter推定を成功裏に維持する。
- 攻撃下のリグレットは$\mathcal{O}((\Lambda\sqrt{N_{ab}})^p\sqrt{T})$で有界であり、$p < 2 + 2(n+m+1)$であるため、データ汚染があってもサブリニアな成長を示す。
- 特別なケース$N_{ab} = T$では、リグレットは$\mathcal{O}(\Lambda^p T^{p+1/2})$に比例し、$p < 2$のときサブリニアのままである。
- 自己修正アルゴリズムは攻撃なしでは$\mathcal{O}(\sqrt{T})$のリグレットを達成し、元のアルゴリズムの最適性能と一致する。
- 図4のシミュレーション結果により、自己修正アルゴリズムが攻撃下でもサブリニアなリグレットを維持していることが確認された一方、ナーブなアルゴリズムは無限大に発散するリグレット成長を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。