[论文解读] Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies
本文提出一种用于深度强化学习(DRL)策略的序列水印方案,通过在独立的隔离环境中嵌入唯一标识符作为确定性的高奖励状态转移序列,实现水印嵌入。该方法训练单一DRL策略同时掌握主任务(如CartPole)和水印触发机制,在主任务上实现近乎相同的性能表现,同时通过成功响应触发序列实现对未经授权复制的检测,且在训练和推理过程中性能下降可忽略不计。
This paper proposes a novel scheme for the watermarking of Deep Reinforcement Learning (DRL) policies. This scheme provides a mechanism for the integration of a unique identifier within the policy in the form of its response to a designated sequence of state transitions, while incurring minimal impact on the nominal performance of the policy. The applications of this watermarking scheme include detection of unauthorized replications of proprietary policies, as well as enabling the graceful interruption or termination of DRL activities by authorized entities. We demonstrate the feasibility of our proposal via experimental evaluation of watermarking a DQN policy trained in the Cartpole environment.
研究动机与目标
- 为应对日益增长的对专有DRL策略免遭直接提取和未经授权复制的保护需求。
- 开发一种对篡改具有鲁棒性且能规避标准模仿学习技术检测的水印机制。
- 使授权实体能够通过预设的稀有状态转移序列序列检测或终止策略执行。
- 确保水印嵌入不会降低策略在原始任务上的性能。
- 探索在AI安全中的应用,例如通过嵌入触发机制实现优雅关机。
提出的方法
- 该方法引入一个独立的、确定性的MDP(水印环境),其状态空间与主环境完全分离,旨在强制执行唯一且高奖励的转移序列。
- 水印环境的设计使得仅通过正确动作序列才能持续获得正向奖励,而任何偏离都将立即导致终止并获得负向奖励。
- 采用联合训练流程,每f_E个训练周期在主DRL环境(如CartPole)与水印环境之间交替训练,使策略能够同时学习两项任务。
- 策略仅在训练期间显式嵌入水印序列时才会响应该序列,从而在测试阶段可被识别。
- 触发序列被设计为水印环境中状态间的循环确定性路径,确保其唯一性并显著降低意外激活的概率。
- 水印嵌入不修改主策略的权重,从而保持原始策略在主任务上的性能。
实验结果
研究问题
- RQ1能否在不降低主任务性能的前提下,训练DRL策略响应一种稀有且确定性的状态转移序列?
- RQ2该水印是否对通过模仿学习或直接权重复制方式提取或仿制策略的攻击具有鲁棒性?
- RQ3该水印是否可用于在真实部署中检测DRL策略的未经授权副本?
- RQ4该水印是否可用于实现远程、授权的策略操作中断或关机?
- RQ5水印环境的引入如何影响主DRL策略的训练稳定性和收敛性?
主要发现
- 采用水印方案训练的DQN策略在主CartPole环境中100次测试的平均回报为500.0,与未水印的DQN策略性能完全一致。
- 在水印环境中,水印策略在100次测试中的平均回报为500.0,证实触发序列已被正确学习并可执行。
- 未水印策略(如DQN、A2C、PPO2)在水印环境中的平均回报分别为1.4、2.81和2.43,证实仅水印策略能成功执行触发序列。
- 训练过程因状态空间和转移动态的扩展而带来额外开销,但两个环境均成功实现收敛。
- 水印方案对主任务造成的性能损失可忽略不计,未水印策略的性能未出现可测量的下降。
- 结果证实,通过一种稀有且确定性的触发序列,可在DRL策略中嵌入唯一且可检测的标识符,且该方法具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。