Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning in Precision Medicine to Preserve Privacy via Encryption

William Briguglio, Parisa Moghaddam|arXiv (Cornell University)|Feb 5, 2021
Cancer Genomics and Diagnostics参考文献 15被引用数 23
ひとこと要約

本論文は、MSK-IMPACT データセットのゲノムデータに対して同型暗号を用いた機械学習と暗号化(MLE)フレームワークを提案する。このフレームワークは暗号化されたデータ上でモデルを学習し、77.47%の精度を達成しており、最近の研究よりわずかに高い。完全同型暗号を用いることで患者のゲノム情報のプライバシーを確保し、すべてのコードとクラウドデプロイメントサービスを公開している。

ABSTRACT

Precision medicine is an emerging approach for disease treatment and prevention that delivers personalized care to individual patients by considering their genetic makeups, medical histories, environments, and lifestyles. Despite the rapid advancement of precision medicine and its considerable promise, several underlying technological challenges remain unsolved. One such challenge of great importance is the security and privacy of precision health-related data, such as genomic data and electronic health records, which stifle collaboration and hamper the full potential of machine-learning (ML) algorithms. To preserve data privacy while providing ML solutions, this article makes three contributions. First, we propose a generic machine learning with encryption (MLE) framework, which we used to build an ML model that predicts cancer from one of the most recent comprehensive genomics datasets in the field. Second, our framework's prediction accuracy is slightly higher than that of the most recent studies conducted on the same dataset, yet it maintains the privacy of the patients' genomic data. Third, to facilitate the validation, reproduction, and extension of this work, we provide an open-source repository that contains the design and implementation of the framework, all the ML experiments and code, and the final predictive model deployed to a free cloud service.

研究の動機と目的

  • 感受性の高いゲノムデータおよび電子的健康記録を共有する際のプライバシー漏洩という、精密医療における重要な課題に対処すること。
  • 生の患者情報が露呈されないまま暗号化されたデータ上でモデルの学習と推論が可能な機械学習フレームワークを開発すること。
  • MSK-IMPACTゲノムデータセットを用いてがんリスクの予測精度を向上させつつ、データのプライバシーを保護すること。
  • オープンソースコード、システム設計、および医療従事者向けの無料クラウドベースの予測サービスの公開を通じて、再現可能性とコミュニティによる拡張を促進すること。

提案手法

  • MLEフレームワークは、Microsoft SEAL に実装されたBFV方式を用いた同型暗号(HE)を統合し、暗号化されたゲノム特徴量上で計算を実行する。
  • 特徴量の前処理には標準化、対数変換、相互情報量またはカイ二乗検定を用いた特徴選択を含め、モデル性能を最適化する。
  • 同型演算と互換性があるため、線形モデル(ロジスティック回帰およびSVM)がHEに適した分類器として選択された。
  • モデルは同型加算および乗算を用いて暗号化された線形スコアを計算し、最終的な復号と意思決定のためにクライアントにのみ暗号化スコアを送信する。
  • 特徴選択および分類器の複数の構成をサポートし、MSK-IMPACT データセット上で合計2,240通りの組み合わせをテストした。
  • 医療従事者がケースをアップロードし、生データを暴露せずに暗号化された予測を取得できる無料のクラウドサービスをデプロイした。

実験結果

リサーチクエスチョン

  • RQ1暗号化されたゲノムデータ上でモデルを学習およびデプロイ可能であり、患者のプライバシーを保護しながら高い予測精度を維持できるか?
  • RQ2同じMSK-IMPACTデータセット上で、同型暗号ベースのモデルの性能は非暗号化モデルと比べてどうなるか?
  • RQ3精度と予測時間の観点から、同型暗号のパrameter設定の違いによる計算上のトレードオフは何か?
  • RQ4医療、機械学習、ソフトウェア工学のコミュニティが、プライバシー保護型機械学習を容易にアクセス可能かつ再現可能にするにはどうすればよいか?
  • RQ5MLEフレームワークは、将来的により複雑なモデルの統合をサポートできるか、かつデータプライバシーを保護できるか?

主な発見

  • MLEフレームワークは、MSK-IMPACT データセット上で77.47%の予測精度を達成し、同データセットに関する最近の公表済み研究を上回った。
  • 精度レベルが異なる場合でもモデルの性能は安定しており、10^3 から 10^9 の乗数範囲で精度が77.41%に安定した。
  • 最も良い設定は標準化とカイ二乗検定による特徴選択を組み合わせたロジスティック回帰分類器であり、77.47%の精度を達成した。
  • フレームワークの暗号化時間はパrameterの選択に大きく依存し、最適な設定では標準マシン上で1サンプルあたり平均約3456秒の予測時間を達成した。
  • 精度レベルが10^6以上ではスコア順位の一致率が100%に達し、相対的ながんリスク順序付けの高さが示された。
  • オープンソースリポジトリをリリースし、完全なコード、モデルデプロイメント、医療従事者が個々の症例を安全にテストできる無料のクラウドサービスを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。