Skip to main content
QUICK REVIEW

[論文レビュー] Stealing Deep Reinforcement Learning Models for Fun and Profit

Kangjie Chen, Shangwei Guo|arXiv (Cornell University)|Jun 9, 2020
Adversarial Robustness in Machine Learning参考文献 53被引用数 4
ひとこと要約

本稿では、行動クエリのみを用いて高精度にブラックボックスDRLポリシーを回復できる、DRLモデルに対する最初のモデル抽出攻撃を提示する。イミュレーション学習と、行動タイミングシーケンスを特徴量として学習する新規なアルゴリズム分類器を活用することで、正確なモデル再構築が可能となり、ウォーターマーキングやクエリレート検知といった防御機構を回避できる。

ABSTRACT

This paper presents the first model extraction attack against Deep Reinforcement Learning (DRL), which enables an external adversary to precisely recover a black-box DRL model only from its interaction with the environment. Model extraction attacks against supervised Deep Learning models have been widely studied. However, those techniques cannot be applied to the reinforcement learning scenario due to DRL models' high complexity, stochasticity and limited observable information. We propose a novel methodology to overcome the above challenges. The key insight of our approach is that the process of DRL model extraction is equivalent to imitation learning, a well-established solution to learn sequential decision-making policies. Based on this observation, our methodology first builds a classifier to reveal the training algorithm family of the targeted black-box DRL model only based on its predicted actions, and then leverages state-of-the-art imitation learning techniques to replicate the model from the identified algorithm family. Experimental results indicate that our methodology can effectively recover the DRL models with high fidelity and accuracy. We also demonstrate two use cases to show that our model extraction attack can (1) significantly improve the success rate of adversarial attacks, and (2) steal DRL models stealthily even they are protected by DNN watermarks. These pose a severe threat to the intellectual property and privacy protection of DRL applications.

研究の動機と目的

  • 特許権が付与されたDRLモデルが、行動クエリのみを介してブラックボックスから抽出可能かどうかを調査すること。
  • DRLモデル抽出における高い複雑性、確率的性質、観測限界といった課題に対処すること。
  • 信頼度スコア、勾配、サイドチャネルデータにアクセスできない状況下でも、高精度なモデル回復が可能な手法を開発すること。
  • 攻撃の実用的影響を示すために、敵対的攻撃の強化やデジタルウォーターマーキングの回避を実証すること。

提案手法

  • DRLモデル抽出を、ブラックボックスDRLポリシーの行動を模倣することを目的とするイミュレーション学習問題として定式化する。
  • 行動シーケンスのみを入力として、ターゲットDRLモデルの訓練アルゴリズムファミリーを予測するRNNベースの分類器を設計する。
  • 予測されたアルゴリズムファミリーを事前知識として用い、イミュレーション学習をガイドすることで、抽出モデルの忠実度と収束性を向上させる。
  • 生成的対抗的イミュレーション学習(GAIL)などの最先端のイミュレーション学習技術を活用し、専門家の行動データからスレーブポリシーを学習する。
  • 模擬環境でターゲットDRLモデルから行動シーケンスを収集し、アルゴリズム分類器の学習とイミュレーションのための専門家軌道の生成に用いる。
  • アルゴリズム分類器とイミュレーション学習パイプラインを統合し、最小限のクエリオーバーヘッドでエンドツーエンドのモデル抽出を実現する。

実験結果

リサーチクエスチョン

  • RQ1信頼度スコア、勾配、サイドチャネル情報にアクセスできない状況下でも、行動出力のみを用いてブラックボックスDRLモデルを抽出可能か?
  • RQ2DRLポリシーに内在する確率的性質と時系列依存性をどのように活用し、背後にある訓練アルゴリズムファミリーを推定できるか?
  • RQ3訓練アルゴリズムファミリーに関する事前知識が、モデル抽出の忠実度と精度にどの程度向上効果をもたらすか?
  • RQ4抽出されたモデルを用いて、敵対的攻撃の成功率を向上させたり、デジタルウォーターマーキングなどの既存のIP保護メカニズムを回避できるか?

主な発見

  • 提案手法は、複雑で深層的なアーキテクチャを用いたターゲットモデルに対しても、高忠実度かつ高精度でDRLモデルを回復できた。
  • アルゴリズム分類器は、行動シーケンスのみを用いても、訓練アルゴリズムファミリーの予測に高い正確性を示し、効果的な事前知識に基づくイミュレーション学習を可能にした。
  • 抽出されたモデルは、敵対的攻撃の成功率を顕著に向上させ、モデル抽出攻撃の実用的脅威を実証した。
  • ウォーターマーキング機構を効果的に回避できた。抽出されたモデルは元のウォーターマーキングを保持しなかったため。
  • 通常のクエリパターン下でも攻撃が有効であり、クエリレート分析に基づく検知機構を回避できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。