Skip to main content
QUICK REVIEW

[论文解读] Machine Learning with Electronic Health Records is vulnerable to Backdoor Trigger Attacks

Byunggill Joe, Akshay Mehra|arXiv (Cornell University)|Jun 15, 2021
Machine Learning in Healthcare被引用 4
一句话总结

本文提出了一种针对基于电子健康记录(EHRs)训练的机器学习模型的新型后门触发攻击,使用时间上一致且统计上合理的触发器,以保持数据模式并规避检测。在训练数据中毒比例不足5%的情况下,该攻击在MIMIC-III数据集上对死亡率预测任务中的逻辑回归、多层感知机和长短期记忆网络模型的攻击成功率高达97%,即使在攻击者不了解模型结构的黑盒设置下依然有效。

ABSTRACT

Electronic Health Records (EHRs) provide a wealth of information for machine learning algorithms to predict the patient outcome from the data including diagnostic information, vital signals, lab tests, drug administration, and demographic information. Machine learning models can be built, for example, to evaluate patients based on their predicted mortality or morbidity and to predict required resources for efficient resource management in hospitals. In this paper, we demonstrate that an attacker can manipulate the machine learning predictions with EHRs easily and selectively at test time by backdoor attacks with the poisoned training data. Furthermore, the poison we create has statistically similar features to the original data making it hard to detect, and can also attack multiple machine learning models without any knowledge of the models. With less than 5% of the raw EHR data poisoned, we achieve average attack success rates of 97% on mortality prediction tasks with MIMIC-III database against Logistic Regression, Multilayer Perceptron, and Long Short-term Memory models simultaneously.

研究动机与目标

  • 调查基于EHR数据训练的机器学习模型在测试时被后门攻击操纵预测结果的脆弱性。
  • 开发一种触发器生成方法,以保持EHR数据的统计和时间特性,从而规避检测。
  • 评估所提出的后门攻击在多种模型上的有效性,以及在不同中毒率和触发强度下的表现。
  • 证明当受害者模型使用未知的数据预处理或插补技术时,该攻击依然有效。
  • 通过揭示基于EHR的机器学习流水线中的关键安全缺陷,强调医疗领域可信人工智能的紧迫需求。

提出的方法

  • 通过利用ICU住院48小时内EHR测量值的时间协方差结构生成触发器,确保时间一致性与合理性。
  • 在中毒数据中保持分类变量不变,避免不自然的转换,从而防止暴露攻击。
  • 在中毒样本中保留原始EHR数据中的缺失值模式,以确保与干净数据的统计相似性。
  • 采用马氏距离度量来衡量触发强度,替代标准的l_p范数,以更好地匹配EHR数据分布。
  • 通过将部分训练数据注入所构建的触发器,实施攻击,随后在包含相同触发器的测试样本上评估模型行为。
  • 该方法在MIMIC-III数据集上的人身死亡率预测任务中进行评估,攻击在标准插补流程之前和之后均进行了测试。

实验结果

研究问题

  • RQ1是否可以设计出在统计上与真实EHR数据无法区分、同时仍能实现高影响力模型操纵的后门触发器?
  • RQ2所提出的触发器生成方法在混合连续、分类和缺失数据的EHR中,多大程度上保持了数据的合理性并规避了检测?
  • RQ3该攻击在多种机器学习模型(如逻辑回归、MLP、LSTM)上对EHR数据训练的模型中,其成功率如何?
  • RQ4在干净数据和插补数据设置下,不同中毒率和触发强度下攻击性能如何变化?
  • RQ5在攻击者对受害者模型架构或预处理流程一无所知的黑盒设置下,该攻击是否仍有效?

主要发现

  • 在训练数据中毒比例不足5%的情况下,该攻击在逻辑回归、多层感知机和长短期记忆网络模型上的人身死亡率预测任务中,平均成功率高达97%。
  • 即使在标准插补流程之后,攻击仍保持高成功率,当触发器应用于所有数据条目(包括插补值)时,成功率最高可达100%。
  • LSTM模型相比逻辑回归和MLP表现出更强的鲁棒性,但使用更强触发器和更高中毒率时,成功率仍达100%。
  • 所提出的利用时间协方差的触发器生成方法,生成的触发器在视觉和统计上均与真实EHR数据相似,而不同于白噪声或全协方差矩阵生成的触发器。
  • 与基于独立白噪声或全协方差矩阵的触发器相比,本方法生成的触发器在视觉和统计比较中显著更难被检测到。
  • 该攻击在黑盒设置下依然有效,因为触发器对受害者模型的架构或预处理流程无依赖性,始终有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。