Skip to main content
QUICK REVIEW

[论文解读] TrojanNet: Embedding Hidden Trojan Horse Models in Neural Networks.

Chuan Guo, Ruihan Wu|arXiv (Cornell University)|Feb 24, 2020
Adversarial Robustness in Machine Learning参考文献 47被引用 20
一句话总结

TrojanNet 提出了一种框架,可在良性神经网络中嵌入隐蔽的恶意后门网络,通过计算上的不可行性实现隐蔽,且具备高度伪装性。该方法可在不降低原始模型性能的前提下实现任意后门功能,暴露了神经网络可信性中的关键安全漏洞。

ABSTRACT

The complexity of large-scale neural networks can lead to poor understanding of their internal details. We show that this opaqueness provides an opportunity for adversaries to embed unintended functionalities into the network in the form of Trojan horses. Our novel framework hides the existence of a Trojan network with arbitrary desired functionality within a benign transport network. We prove theoretically that the Trojan network's detection is computationally infeasible and demonstrate empirically that the transport network does not compromise its disguise. Our paper exposes an important, previously unknown loophole that could potentially undermine the security and trustworthiness of machine learning.

研究动机与目标

  • 探究是否可以在不被检测的情况下将对抗性后门嵌入大规模神经网络。
  • 应对模型不透明性日益增长的担忧,该问题可能导致部署中的AI系统出现安全漏洞。
  • 设计一种框架,将后门功能隐蔽地嵌入良性模型中,同时保持原始性能。
  • 证明在现实条件下,检测此类后门在计算上是不可行的。
  • 揭示机器学习系统中此前未知的关键安全漏洞。

提出的方法

  • 该框架将具有任意功能的后门网络作为隐藏模块集成到预训练的良性神经网络中。
  • 利用架构混淆技术,确保后门在推理和训练过程中均保持不可检测。
  • 后门仅在特定且罕见的输入模式下被触发,从而在正常运行期间降低被怀疑的可能性。
  • 该方法确保在集成后,良性网络的准确率保持不变,维持功能伪装。
  • 理论分析证明,在标准假设下,检测隐藏后门在计算上是不可行的。
  • 实证评估证实,即使在标准模型检查和对抗性测试下,后门仍保持不可检测。

实验结果

研究问题

  • RQ1是否可以在不改变神经网络在正常运行期间的表观行为的前提下,嵌入恶意后门?
  • RQ2是否在计算上不可行,使用标准模型分析技术检测此类隐藏后门?
  • RQ3在不降低性能的前提下,后门功能在良性模型中可被伪装到何种程度?
  • RQ4该框架如何在嵌入功能性后门的同时保持原始模型的准确性?
  • RQ5模型不透明性对已部署机器学习系统的安全性和可信性有何影响?

主要发现

  • 由于计算上的不可行性,标准模型检查技术无法检测到后门网络的存在。
  • 良性传输网络在嵌入后门后仍保持原始准确率和性能,维持了功能伪装。
  • 后门仅在罕见且特定的输入模式下被触发,从而在正常使用中降低了被检测的可能性。
  • 实证结果证实,即使在对抗性测试和模型分析下,后门仍保持不可检测。
  • 该框架表明,模型不透明性使得神经网络中存在此前未知的安全漏洞。
  • 本研究揭示,当前防御机制对大规模模型中此类隐蔽嵌入后门的防护能力不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。