Skip to main content
QUICK REVIEW

[论文解读] Adversarial jamming attacks and defense strategies via adaptive deep reinforcement learning

Feng Wang, Chen Zhong|arXiv (Cornell University)|Jul 12, 2020
Adversarial Robustness in Machine Learning参考文献 31被引用 8
一句话总结

本文提出一种基于深度强化学习(DRL)的动态自适应干扰攻击,以及三种防御策略——带PID控制的多样化防御、模仿攻击者防御和正交策略防御,针对执行DRL动态信道接入的受害用户。核心贡献在于证明正交策略可通过区分对抗性干扰与环境变化,实现有效的攻击检测,而基于模仿的防御在攻击下可实现高达90%的准确率。

ABSTRACT

As the applications of deep reinforcement learning (DRL) in wireless communications grow, sensitivity of DRL based wireless communication strategies against adversarial attacks has started to draw increasing attention. In order to address such sensitivity and alleviate the resulting security concerns, we in this paper consider a victim user that performs DRL-based dynamic channel access, and an attacker that executes DRLbased jamming attacks to disrupt the victim. Hence, both the victim and attacker are DRL agents and can interact with each other, retrain their models, and adapt to opponents' policies. In this setting, we initially develop an adversarial jamming attack policy that aims at minimizing the accuracy of victim's decision making on dynamic channel access. Subsequently, we devise defense strategies against such an attacker, and propose three defense strategies, namely diversified defense with proportional-integral-derivative (PID) control, diversified defense with an imitation attacker, and defense via orthogonal policies. We design these strategies to maximize the attacked victim's accuracy and evaluate their performances.

研究动机与目标

  • 解决无线系统中基于DRL的动态信道接入在对抗性干扰攻击下的安全漏洞。
  • 将基于DRL的受害用户与基于DRL的干扰者之间的交互建模为一种动态自适应博弈,其中双方代理在相互响应中持续学习与重训练。
  • 设计并评估三种新型防御策略——带PID控制的多样化防御、基于模仿攻击者的防御和正交策略防御,以提升受害用户在攻击下的准确率。
  • 开发一种攻击检测机制,利用正交策略作为诊断工具,区分信道状态中的对抗性干扰与环境变化。

提出的方法

  • 攻击者使用深度演员-critic DRL框架,学习一种最小化受害用户信道接入准确率的动态干扰策略。
  • 受害用户采用DRL代理实现动态多信道接入,防御策略被集成以增强对攻击者行为的鲁棒性。
  • 带PID控制的多样化防御通过实时调整信道选择概率实现,无需事先建模攻击者,仅依赖性能指标的反馈。
  • 模仿攻击者防御通过训练一个代理DRL代理来模仿攻击者的行为,使受害用户能够预测并反击攻击模式。
  • 正交策略防御预先训练多个独立的DRL策略,并在它们之间切换以干扰攻击者,其检测能力基于准确率的突然下降。
  • 通过监控正交策略下的准确率实现攻击检测策略:急剧下降表示干扰,缓慢恢复则表明环境变化。

实验结果

研究问题

  • RQ1即使干扰功率有限,基于DRL的干扰者是否能有效降低基于DRL的受害用户在动态多信道接入中的性能?
  • RQ2在无事先攻击者建模的情况下,多样化防御策略(尤其是此类策略)如何提升对抗性干扰下的受害用户准确率?
  • RQ3正交策略是否不仅能作为防御机制,还能作为诊断工具,以区分对抗性攻击与环境变化?
  • RQ4不同防御策略在防御准确率、训练开销和适应性之间的性能权衡如何?
  • RQ5与其它策略相比,防御中使用模仿攻击者策略在鲁棒性和可实现准确率方面表现如何?

主要发现

  • 仅使用最大干扰功率的30%,基于DRL的攻击者将受害用户的信道接入准确率降低至34.6%,表明攻击效率极高。
  • 带PID控制的多样化防御在无攻击者先验知识的情况下,使受害用户准确率达到39%,在未知攻击场景中表现出强鲁棒性。
  • 基于模仿攻击者的防御策略在攻击下最高可实现90%的准确率,表明其在各种条件下均具备强大适应性与抗扰性。
  • 正交策略防御在攻击期间将受害用户准确率维持在约50%,并通过在环境变化时立即降至接近零的准确率,实现有效的攻击检测。
  • 正交策略防御可实现可靠的攻击检测:准确率迅速下降表示干扰,缓慢恢复则表明环境变化,从而支持动态切换至适当的防御机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。