[论文解读] Provable Defense against Backdoor Policies in Reinforcement Learning
本文在子空间触发假设下,提出了一种可证明的后门策略净化防御方法。通过使用SVD从干净环境交互中估计的安全子空间,将状态投影到该子空间,该方法无需微调即可使后门策略具备鲁棒性,并在$O\left(\frac{D}{(1-\gamma)^4\epsilon^2}\right)$个干净样本下实现$\epsilon$-近似最优性,且在Atari游戏上通过实证验证。
We propose a provable defense mechanism against backdoor policies in reinforcement learning under subspace trigger assumption. A backdoor policy is a security threat where an adversary publishes a seemingly well-behaved policy which in fact allows hidden triggers. During deployment, the adversary can modify observed states in a particular way to trigger unexpected actions and harm the agent. We assume the agent does not have the resources to re-train a good policy. Instead, our defense mechanism sanitizes the backdoor policy by projecting observed states to a 'safe subspace', estimated from a small number of interactions with a clean (non-triggered) environment. Our sanitized policy achieves $ε$ approximate optimality in the presence of triggers, provided the number of clean interactions is $O\left(\frac{D}{(1-γ)^4 ε^2} ight)$ where $γ$ is the discounting factor and $D$ is the dimension of state space. Empirically, we show that our sanitization defense performs well on two Atari game environments.
研究动机与目标
- 在子空间触发假设下,正式定义强化学习中的后门策略。
- 开发一种无需策略微调即可净化后门策略的可证明防御机制。
- 确保净化后的策略在干净环境和触发环境中均保持近似最优性能。
- 在Atari游戏环境中,在现实攻击条件下实证验证该防御方法。
提出的方法
- 该防御方法通过奇异值分解(SVD)对来自干净环境交互的状态特征进行估计,将观测到的状态投影到安全子空间中。
- 安全子空间被定义为干净状态经验协方差矩阵的前导特征向量的张成空间。
- 该方法假设触发信号位于低维正交子空间$E^\perp$中,从而可通过投影消除触发影响。
- 净化后的策略通过在将状态投影到安全子空间后应用后门策略来构建。
- 安全子空间的维度$d$通过经验协方差矩阵中的谱间隙来估计。
- 该防御为封装式方法——无需对原始策略进行微调。
实验结果
研究问题
- RQ1能否在触发信号被限制于低维子空间的强化学习后门策略中构建可证明的防御?
- RQ2为确保性能边界,估计安全子空间所需的样本复杂度是多少?
- RQ3随着干净环境交互次数的增加,净化后策略的性能如何变化?
- RQ4该防御是否能在不微调的情况下,同时在干净环境和触发环境中保持近似最优性能?
- RQ5该防御对安全子空间维度$d$的估计错误有多敏感?
主要发现
- 在存在触发信号的情况下,净化后的策略实现了$\epsilon$-近似最优性,样本复杂度为$O\left(\frac{D}{(1-\gamma)^4\epsilon^2}\right)$次干净交互。
- 实证结果表明,随着干净样本数量$n$的增加,净化后策略的性能持续提升,即使在触发条件下也能最终恢复原始干净环境下的性能。
- 在Boxing-Ram环境中,当$n=40$且$d \approx 24$时即观察到性能恢复;而在Breakout环境中,需要$n=32768$且$d \approx 20000$才能实现恢复。
- 对安全子空间维度$d$的高估或低估均会降低性能,凸显了通过谱间隙检测实现准确$d$估计的重要性。
- 该方法在两个Atari环境中成功缓解了后门攻击,且无需微调,证明了基于封装式净化方法的实际可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。