[论文解读] URET: Universal Robustness Evaluation Toolkit (for Evasion)
URET 是一种通用框架,通过将对抗性样本生成建模为领域特定、功能保持的变换图探索问题,在多种人工智能系统模态中生成语义正确且功能有效的对抗性输入。该框架实现了对非图像输入(如恶意软件二进制文件)的有效逃避攻击,在 VirusTotal 上实现了 58% 的平均检测率,展示了超越图像攻击的可转移性和实际影响。
Machine learning models are known to be vulnerable to adversarial evasion attacks as illustrated by image classification models. Thoroughly understanding such attacks is critical in order to ensure the safety and robustness of critical AI tasks. However, most evasion attacks are difficult to deploy against a majority of AI systems because they have focused on image domain with only few constraints. An image is composed of homogeneous, numerical, continuous, and independent features, unlike many other input types to AI systems used in practice. Furthermore, some input types include additional semantic and functional constraints that must be observed to generate realistic adversarial inputs. In this work, we propose a new framework to enable the generation of adversarial inputs irrespective of the input type and task domain. Given an input and a set of pre-defined input transformations, our framework discovers a sequence of transformations that result in a semantically correct and functional adversarial input. We demonstrate the generality of our approach on several diverse machine learning tasks with various input representations. We also show the importance of generating adversarial examples as they enable the deployment of mitigation techniques.
研究动机与目标
- 解决非图像人工智能系统中缺乏可泛化的对抗性攻击框架的问题,这些系统具有复杂的输入结构。
- 克服依赖可微分、连续且独立特征的基于梯度的攻击方法的局限性——这些特征在图像中常见,但在二进制文件或表格特征等真实世界数据中并不常见。
- 通过在多种领域生成语义正确且功能有效的对抗性输入,实现对安全关键型 AI 系统的实际对抗性测试。
- 提供一个可重用、可扩展的工具包,支持自定义变换,并可集成到评估与缓解管道中,以支持鲁棒 AI 开发。
- 在真实世界检测系统(如 VirusTotal)中展示对抗性可转移性的有效性,以突出实际风险并强调对鲁棒防御的需求。
提出的方法
- 将对抗性输入生成建模为图探索问题,其中节点表示输入,边表示领域特定的变换。
- 为常见数据类型(如图像、文本、二进制文件、表格数据)定义一组预配置的功能性和语义性保持变换。
- 提供可插拔的变换接口,允许用户利用领域特定知识,为不支持的数据类型定义自定义变换。
- 使用可配置深度和宽度的束搜索(beam search),探索最大化对抗性成功率同时保持输入有效性的变换序列。
- 通过在多个模型和检测系统上评估生成的样本,利用对抗性可转移性来评估泛化能力和实际影响。
- 通过配置文件抽象低级实现细节,实现对不同机器学习任务和输入表示的轻松定制。

实验结果
研究问题
- RQ1通用框架能否在图像以外的多种人工智能输入模态中,生成既语义正确又功能有效的对抗性输入?
- RQ2基于图的变换序列探索在生成可逃避真实世界系统检测的对抗性样本方面有多有效?
- RQ3URET 生成的对抗性样本在不同检测模型之间(如 VirusTotal 中的模型)可转移性的程度如何?
- RQ4与基于图像的对抗性特征进行对抗性训练相比,使用 URET 生成的功能有效对抗性输入进行对抗性训练,在鲁棒性方面有何差异?
- RQ5该框架能否通过用户定义的变换扩展到新数据类型,而无需修改核心工具包?
主要发现
- URET 使用束宽 5 和深度 3,成功生成了 38 个对抗性恶意软件二进制文件,证明了其在复杂二进制输入空间中的可行性。
- 对抗性恶意软件二进制文件在 VirusTotal 上的平均检测率从原始样本的 82% 降至 58%,其中有一个检测器仅将 6% 标记为恶意。
- 在六个匿名的 VirusTotal 扫描器中,精确率和召回率指标显著下降,召回率从 100% 降至部分检测器的最低 28%。
- 基于图像的对抗性特征进行的对抗性训练对 URET 生成的功能有效对抗性输入完全无效,凸显了当前防御策略的局限性。
- 该框架在多种任务中表现出高效率——包括恶意软件检测、HMDA 信用风险预测和图像分类——仅需极少的配置更改。
- URET 生成的对抗性样本表现出强大的可转移性,成功规避了多个检测系统,凸显了此类攻击在现实世界中的威胁。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。