[论文解读] Data Poisoning Attacks in Contextual Bandits
本文提出了一种基于优化的对抗性数据污染攻击框架,针对上下文Bandit模型,通过操纵历史奖励值,使在特定上下文下目标臂被选中。通过求解凸优化问题,攻击者在高维空间中实现了高成功率且副作用极小,凸显了推荐与医疗应用中强化学习系统存在的严重安全漏洞。
We study offline data poisoning attacks in contextual bandits, a class of reinforcement learning problems with important applications in online recommendation and adaptive medical treatment, among others. We provide a general attack framework based on convex optimization and show that by slightly manipulating rewards in the data, an attacker can force the bandit algorithm to pull a target arm for a target contextual vector. The target arm and target contextual vector are both chosen by the attacker. That is, the attacker can hijack the behavior of a contextual bandit. We also investigate the feasibility and the side effects of such attacks, and identify future directions for defense. Experiments on both synthetic and real-world data demonstrate the efficiency of the attack algorithm.
研究动机与目标
- 研究离线数据污染攻击在广泛应用于在线推荐与自适应医疗治疗的上下文Bandit系统中的可行性。
- 开发一种通用攻击框架,通过操纵历史奖励值,强制在目标上下文中选择特定臂。
- 分析此类攻击的副作用与可检测性,特别是在高维与真实世界设置下的表现。
- 识别上下文Bandit系统中攻击与防御机制的未来研究方向。
提出的方法
- 攻击框架将污染问题建模为凸优化任务,攻击者通过修改历史奖励值,使估计的参数向量倾向于在目标上下文中选择目标臂。
- 该方法采用约束优化方法,确保扰动后的奖励值与原始值保持在较小偏差范围内,从而最小化可检测性。
- 攻击者指定目标上下文 $x^*$ 和目标臂 $a^*$,并求解使Bandit算法策略在观测到 $x^*$ 时选择 $a^*$ 的奖励扰动。
- 优化过程考虑了线性上下文Bandit中使用的正则化与噪声模型,确保攻击在标准学习算法下依然有效。
- 副作用通过在测试上下文集上测量策略因攻击而偏离原始策略的上下文比例来量化。
- 在合成数据与真实世界数据集上进行实验,评估在不同维度、臂的数量与用户频率下的攻击成功率与副作用。
实验结果
研究问题
- RQ1攻击者是否能仅通过污染历史奖励值,而不改变上下文或动作,成功劫持上下文Bandit策略?
- RQ2攻击副作用(定义为策略发生偏离的上下文比例)如何随臂的数量与问题维度变化?
- RQ3在高维设置下,该攻击的可检测性如何?与低维或真实世界用户频率场景相比有何差异?
- RQ4该攻击能否扩展至同时针对多个上下文?其主要挑战是什么?
- RQ5防御者如何利用副作用检测此类数据污染攻击?攻击者可采取何种策略以最小化检测?
主要发现
- 该攻击在存在真实噪声与正则化设置下,仍能以高精度强制上下文Bandit在目标上下文中选择目标臂。
- 在高维空间中(例如,$d=200$),副作用比例降至0.035,表明随着维度增加,攻击的可检测性显著降低。
- 在真实世界数据中,副作用随用户频率变化:高频用户分别为53.91%与50.40%,而中频用户仅为7.50%,显示出可检测性的差异。
- 在不同臂数($K=2, 20, 200$)下的副作用中位数稳定在0.2–0.3之间,表明其不随 $K$ 显著增长。
- 即使目标臂在目标上下文中原本是表现最差的臂,该攻击依然有效,表明攻击对学习过程具有强大控制力。
- 结果揭示了依赖上下文Bandit的现实世界AI系统存在严重安全威胁,尤其在推荐与医疗等应用中,数据污染可能造成长期后果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。