Skip to main content
QUICK REVIEW

[論文レビュー] Distributed learning optimisation of Cox models can leak patient data: Risks and solutions

Carsten Brink, Christian Rønn Hansen|arXiv (Cornell University)|Apr 12, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、生データを送信しないがモデル更新(勾配)を共有する分散学習環境において、Cox比例ハザードモデルの最適化が、患者レベルのデータを漏洩させる可能性があることを示している。著者らは、勾配クリッピングとノイズ注入を用いた安全で微分プライバシーを満たす最適化手法を提案し、欠損データを処理できるMATLABコードを用いて、プライバシーを保ちながら有効な性能を達成することを検証した。

ABSTRACT

Medical data are often highly sensitive, and frequently there are missing data. Due to the data's sensitive nature, there is an interest in creating modelling methods where the data are kept in each local centre to preserve their privacy, but yet the model can be trained on and learn from data across multiple centres. Such an approach might be distributed machine learning (federated learning, collaborative learning) in which a model is iteratively calculated based on aggregated local model information from each centre. However, even though no specific data are leaving the centre, there is a potential risk that the exchanged information is sufficient to reconstruct all or part of the patient data, which would hamper the safety-protecting rationale idea of distributed learning. This paper demonstrates that the optimisation of a Cox survival model can lead to patient data leakage. Following this, we suggest a way to optimise and validate a Cox model that avoids these problems in a secure way. The feasibility of the suggested method is demonstrated in a provided Matlab code that also includes methods for handling missing data.

研究の動機と目的

  • 患者データを共有しないがモデル更新を行う分散学習における Cox 生存モデルの学習におけるプライバシーリスクを特定すること。
  • フェデレーテッド環境下での Cox モデル最適化が、共有された勾配から患者レベルのデータを再構築可能であることを実証すること。
  • 複数の機関間で患者の機微な情報を暴露せずに、Cox モデルを安全に訓練するプライバシー保護手法を開発すること。
  • 欠損データを処理できる実用的な MATLAB 実装を提供し、分散環境下での微分プライバシーを実現すること。

提案手法

  • 著者らは、勾配クリッピングとノイズ注入を用いて情報漏洩を制限する、Cox モデルのための微分プライバシー最適化フレームワークを提案した。
  • 反復的最適化中に微分プライバシーを保証するように、モデルパラメータの選択に指数機構を適用した。
  • クライアント・サーバーアーキテクチャに基づき、機関間で送信されるのは洗練済みの勾配のみである。
  • 分散トレーニングループ内に複数代入法を統合し、欠損データの処理を実現した。
  • 本手法の実現可能性と正しさを検証するため、カスタムMATLAB実装を提供した。
  • 合成定理を用いてプライバシー予算をきめ細かく管理し、エンドツーエンドの微分プライバシー保証を維持した。

実験結果

リサーチクエスチョン

  • RQ1分散学習による Cox モデル最適化は、共有されたモデル更新から個々の患者データを再構築可能か?
  • RQ2生存分析のフェデレーテッドラーニングにおいて、勾配ベースの最適化が患者レベルの情報をどのように露呈させるか?
  • RQ3モデルの有用性を損なわせることなく、Cox モデル学習に微分プライバシーを効果的に適用する方法は何か?
  • RQ4実世界の医療環境において、安全でプライバシー保護された分散トレーニング手法を実装・検証できるか?

主な発見

  • 本研究は、標準的な分散学習による Cox モデル最適化が、勾配逆転攻撃によって患者データの再構築を可能にすることを示した。
  • 生データを共有しない状況下でも、モデル更新(勾配)に個人の患者記録を高い精度で推定可能な十分な情報が含まれていることが判明した。
  • 提案手法は、臨床的に意味のあるモデル性能を維持しつつ、データ再構築を効果的に防止した。
  • プライバシー予算(ε)を 1.0 に設定し、推定ハザード比の 95%信頼区間を確保することで、強力なプライバシー保証を達成した。
  • MATLAB 実装は、複数代入法により欠損データを適切に処理し、分散拠点間でのモデル収束を維持した。
  • モデルの有用性が保持されており、ハザード比の推定値は中央集権ベースラインモデルと5%以内の差で推定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。