Skip to main content
QUICK REVIEW

[论文解读] The TrojAI Software Framework: An OpenSource tool for Embedding Trojans into Deep Learning Models

Kiran Karra, Chace Ashcraft|arXiv (Cornell University)|Mar 13, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 20
一句话总结

TrojAI 软件框架是一个开源的 Python 工具包,通过使用可配置触发器污染数据集,实现了可扩展、可复现的后门深度学习模型生成。该框架在 MNIST 分类器和强化学习智能体中展示了有效的后门植入效果,表明触发器类型、批量大小和污染率显著影响成功率,而 Neural Cleanse 仅在 18% 的情况下检测到异常。

ABSTRACT

In this paper, we introduce the TrojAI software framework, an open source set of Python tools capable of generating triggered (poisoned) datasets and associated deep learning (DL) models with trojans at scale. We utilize the developed framework to generate a large set of trojaned MNIST classifiers, as well as demonstrate the capability to produce a trojaned reinforcement-learning model using vector observations. Results on MNIST show that the nature of the trigger, training batch size, and dataset poisoning percentage all affect successful embedding of trojans. We test Neural Cleanse against the trojaned MNIST models and successfully detect anomalies in the trained models approximately $18\%$ of the time. Our experiments and workflow indicate that the TrojAI software framework will enable researchers to easily understand the effects of various configurations of the dataset and training hyperparameters on the generated trojaned deep learning model, and can be used to rapidly and comprehensively test new trojan detection methods.

研究动机与目标

  • 通过提供统一、可配置的框架来生成污染数据集和后门模型,解决后门攻击研究中缺乏标准化和可复现性的问题。
  • 支持系统性研究触发器设计、污染率和训练超参数如何影响后门植入成功率与可检测性。
  • 支持在多种数据模态和模型架构上对新型后门检测与缓解技术进行快速评估与基准测试。
  • 将可复现的后门攻击研究从图像分类扩展至使用向量观测环境的强化学习。
  • 促进未来对更隐蔽的后门植入方法以及更广泛的数据模态支持(如音频、目标检测)的研究。

提出的方法

  • 该框架由两个核心子模块组成:datagen 用于生成带有用户定义触发器的污染数据集,modelgen 用于在这些数据集上训练深度学习模型。
  • 支持可配置的触发器类型(如静态、动态、旋转)、放置策略以及输入数据中的污染百分比。
  • 在强化学习中,该框架与 OpenAI Gym 环境集成,允许在训练期间向基于向量的观测中注入触发器。
  • 该框架支持使用不同超参数(如批量大小、训练轮数)批量训练多个模型,以评估鲁棒性并获得结果。
  • 支持通过标准指标进行评估,如在干净数据和触发数据上的准确率,以及强化学习任务中的累积奖励。
  • 使用 Neural Cleanse 作为检测基线,评估不同配置下后门模型的可检测性。

实验结果

研究问题

  • RQ1触发器类型(静态 vs. 动态)和放置方式如何影响 MNIST 分类器中后门植入的成功率?
  • RQ2数据集污染百分比和批量大小对后门模型的模型产出率和鲁棒性有何影响?
  • RQ3TrojAI 框架能否有效生成基于向量观测的可功能后门强化学习智能体?
  • RQ4Neural Cleanse 检测方法在不同后门配置下的异常检测率表现如何?
  • RQ5某一触发器或配置下的结果在可检测性和模型性能方面,能在多大程度上推广到其他触发器或配置?

主要发现

  • TrojAI 框架成功生成了高干净准确率(>95%)的后门 MNIST 分类器,并在触发输入上实现了目标误分类,证明了后门注入的有效性与可扩展性。
  • 模型产出率和检测性能在不同触发器类型和配置下差异显著,其中动态触发器相比静态触发器表现出更低的 Neural Cleanse 检测率。
  • 批量大小对训练收敛有明显影响,较大批量(64)平均所需轮数(17.9±2.9)少于较小批量(16:14.1±2.4)。
  • Neural Cleanse 在所有配置下仅以约 18% 的成功率检测到后门模型,表明检测性能的泛化能力有限。
  • 在强化学习中,Boxing 智能体在干净环境中保持高性能(平均奖励 52.22),在污染环境中性能显著下降(-62.69),证实了后门植入的成功。
  • 该框架的模块化设计支持在多种数据模态、超参数和模型架构下实现一致且可复现的实验,支持大规模基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。