Skip to main content
QUICK REVIEW

[論文レビュー] Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments

Amin Rakhsha, Xuezhou Zhang|arXiv (Cornell University)|Feb 16, 2021
Adversarial Robustness in Machine Learning被引用数 16
ひとこと要約

本稿では、環境や学習アルゴリズムに関する事前知識が一切ない状況下で動作する、強化学習における新規なブラックボックス報酬汚染攻撃U2を提案する。最小限の仮定のもとで、ノーレグレット強化学習学習者が示す探索行動を活用することで、ホワイトボックス攻撃とほぼ同等の性能を達成しており、未知の未知の状況下でも効果的な報酬汚染が可能であることを示している。

ABSTRACT

We study black-box reward poisoning attacks against reinforcement learning (RL), in which an adversary aims to manipulate the rewards to mislead a sequence of RL agents with unknown algorithms to learn a nefarious policy in an environment unknown to the adversary a priori. That is, our attack makes minimum assumptions on the prior knowledge of the adversary: it has no initial knowledge of the environment or the learner, and neither does it observe the learner's internal mechanism except for its performed actions. We design a novel black-box attack, U2, that can provably achieve a near-matching performance to the state-of-the-art white-box attack, demonstrating the feasibility of reward poisoning even in the most challenging black-box setting.

研究の動機と目的

  • 攻撃者が環境や強化学習エージェントの学習アルゴリズムについて一切知識を持たないという、最も現実的で挑戦的な状況下における報酬汚染攻撃の可能性を調査すること。
  • 攻撃者がエージェントの内部メカニズムを観測できないが、行動のみを観測できるという最小限の仮定のもとで、ブラックボックス攻撃戦略を設計すること。
  • 事前知識が一切ない状況下でも、巧みに設計された報酬操作により、攻撃者が強化学習エージェントを悪意ある方策へ誘導できることを示すこと。
  • ノーレグレット強化学習アルゴリズムが探索を内蔵している性質を活用し、全状態行動空間を効率的に探索可能な新しい探索サブルーチンを設計すること。これは、攻撃の効果的実行に不可欠である。

提案手法

  • 攻撃者がエージェントの行動のみを観測し、学習アルゴリズムがノーレグレット学習に従うと仮定する、ブラックボックス報酬汚染攻撃U2を提案する。
  • 任意のノーレグレット強化学習アルゴリズムを、報酬に依存せず、タスクに依存しない学習者に変換する探索サブルーチンを設計する。このサブルーチンにより、全状態行動空間を効率的に探索可能となる。
  • 二段階の攻撃戦略を採用する:第一段階は、全状態行動ペアにわたるデータ収集を目的とした自己教師付き探索フェーズ。第二段階は、エージェントが望ましい方策を学習するように誘導する標的攻撃フェーズ。
  • 確率的集中不等式と劣化解析を用いて攻撃コストを上限付け、最小限の仮定のもとで白ボックス攻撃に近いコストを保証する。
  • ノーレグレット学習アルゴリズムが本質的に探索を行うという事実を活用し、効果的な汚染に必要な十分なデータ収集を攻撃者が実現可能である。
  • 報酬の摂動と方策のずれの両方を考慮した、耐性に配慮したコスト関数を導入し、攻撃の不顕著さと有効性を確保する。

実験結果

リサーチクエスチョン

  • RQ1攻撃者が環境や強化学習エージェントの学習アルゴリズムについて一切知識を持たないブラックボックス状況下でも、効果的な報酬汚染が達成可能か?
  • RQ2ノーレグレット強化学習エージェントの探索行動をどのように活用し、事前知識なしに汚染に必要な十分なデータを収集できるか?
  • RQ3攻撃者が真の環境ダイナミクスやエージェントの内部パrameterにアクセスできない状況下で、ブラックボックス攻撃はホワイトボックス攻撃とどの程度性能を比較できるか?
  • RQ4未知の環境下で効果的な報酬汚染を可能にする自己教師付き探索サブルーチンを設計可能か?
  • RQ5最小限の仮定のもとで、このような攻撃のコストと成功確率について、どのような理論的保証を提供できるか?

主な発見

  • 攻撃者が環境や学習アルゴリズムについての知識を持たないにもかかわらず、U2は最適なホワイトボックス攻撃に近い攻撃コストを達成している。
  • 攻撃コストは、ターゲット方策の劣化度に比例する項で上限付けられており、ターゲット方策がエージェントの行動と完全に一致していなくても、本手法が有効であることを示している。
  • 探索サブルーチンにより、全状態行動空間のカバレッジが成功裏に達成されており、これは攻撃の成功に不可欠であり、後続の強化学習タスクに対しても独立した価値を持つ。
  • 高い確率(少なくとも1−4p)で、攻撃コストが有界かつ最適に近くなることが、集中不等式とユニオンボンドを用いた解析により証明された。
  • 攻撃者が真の環境ダイナミクスやエージェントの内部方策を観測しない状況下でも、攻撃は依然として有効である。これは、現実的な状況下でのブラックボックス報酬汚染の可能性を示している。
  • 理論的解析により、最小限の仮定のもとで攻撃者がほぼ最適な性能を達成できることを確認した。これは、効果的な攻撃にはホワイトボックス知識が不可欠であるという従来の仮定に疑問を呈するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。