Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning with Electronic Health Records is vulnerable to Backdoor Trigger Attacks

Byunggill Joe, Akshay Mehra|arXiv (Cornell University)|Jun 15, 2021
Machine Learning in Healthcare被引用数 4
ひとこと要約

本稿では、電子的医療記録(EHR)に学習させた機械学習モデルを標的とする、時間的に整合性があり統計的に妥当なトリガーを用いた背後へのバックドア攻撃を提案する。訓練データの5%未満を汚染することで、MIMIC-IIIデータセットを用いた死亡予測タスクにおいて、ロジスティック回帰、マルチレイヤーパーセプトロン、LSTMモデルの全般的に97%の成功確率を達成し、モデルの詳細を知らないブラックボックス環境下でも有効である。

ABSTRACT

Electronic Health Records (EHRs) provide a wealth of information for machine learning algorithms to predict the patient outcome from the data including diagnostic information, vital signals, lab tests, drug administration, and demographic information. Machine learning models can be built, for example, to evaluate patients based on their predicted mortality or morbidity and to predict required resources for efficient resource management in hospitals. In this paper, we demonstrate that an attacker can manipulate the machine learning predictions with EHRs easily and selectively at test time by backdoor attacks with the poisoned training data. Furthermore, the poison we create has statistically similar features to the original data making it hard to detect, and can also attack multiple machine learning models without any knowledge of the models. With less than 5% of the raw EHR data poisoned, we achieve average attack success rates of 97% on mortality prediction tasks with MIMIC-III database against Logistic Regression, Multilayer Perceptron, and Long Short-term Memory models simultaneously.

研究の動機と目的

  • EHRデータに学習させた機械学習モデルが、テスト時における予測を操作するバックドア攻撃に対してどれほど脆弱であるかを調査すること。
  • EHRデータの統計的および時間的特性を保ちつつ、検出を回避できるトリガー生成手法を開発すること。
  • 提案されたバックドア攻撃の有効性を、複数のモデルおよび異なる汚染率やトリガー強度の下で評価すること。
  • 攻撃が、被害者のモデルの前処理や補完手法が未知である状況でも有効であることを示すこと。
  • EHRベースの機械学習パイプラインにおける深刻なセキュリティ欠陥を暴露することで、医療分野における信頼性のあるAIの必要性を強調すること。

提案手法

  • トリガーは、ICU滞在48時間内のEHR測定値の時間的共分散構造を用いて生成され、時間的整合性と妥当性が保証される。
  • カテゴリカル変数は汚染データにそのままで保持され、攻撃を露呈する不自然な変換を回避する。
  • 元のEHRデータ内の欠損値パターンが汚染サンプルにも維持され、清浄データと統計的に類似した状態を保つ。
  • トリガー強度の測定には、EHRデータ分布に適した標準的な l_p 範囲に代わるマハラノビス距離ベースの指標が用いられる。
  • 攻撃は、作成されたトリガーを含む訓練データの一部を汚染することで実行され、同じトリガーを含むテスト例でのモデル挙動が評価される。
  • 本手法は、MIMIC-IIIデータセットを用いた死亡予測タスクで評価され、標準的な補完手順の前後で攻撃がテストされた。

実験結果

リサーチクエスチョン

  • RQ1統計的に実際のEHRデータと区別できないトリガーを設計できるか、かつ依然として高い影響力を持つモデル操作が可能か?
  • RQ2本研究で提案するトリガー生成手法は、連続的・カテゴリカル・欠損値を含むEHRデータにおいて、データの妥当性を保ちつつ検出を回避できるか?
  • RQ3ロジスティック回帰、MLP、LSTMなどの多様な機械学習モデルに対して、この攻撃はどの程度効果を発揮するか?
  • RQ4清浄データおよび補完済みデータの両設定下で、異なる汚染率やトリガー強度の下で攻撃の性能はどのように変化するか?
  • RQ5攻撃者が被害者のモデルアーキテクチャや前処理パイプラインを一切知らないブラックボックス環境下でも、攻撃は有効に機能するか?

主な発見

  • 訓練データの5%未満を汚染した状態で、ロジスティック回帰、マルチレイヤーパーセプトロン、長短期記憶(LSTM)モデルの全般的に死亡予測タスクで平均97%の成功率を達成した。
  • 標準的な補完手順を経ても攻撃の成功率が高く維持され、トリガーがすべてのデータ項目(含む補完済み値)に適用された場合には、成功率が最大100%に達した。
  • LSTMモデルはロジスティック回帰やMLPに比べて攻撃に対してより高い耐性を示したが、より強いトリガーや高い汚染率を用いることで依然100%の成功率を達成した。
  • 時間的共分散を活用した本研究のトリガー生成手法により、白ノイズや全共分散行列に基づくトリガーとは異なり、視覚的および統計的に実際のEHRデータに類似したトリガーが生成された。
  • 視覚的および統計的比較により、独立した白ノイズや全共分散行列に基づくトリガーと比較して、本手法で生成されたトリガーは著しく検出が困難であることが示された。
  • 攻撃はブラックボックス環境下でも有効であり、被害者のモデルアーキテクチャや前処理パイプラインにかかわらず、トリガーが効果を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。