Skip to main content
QUICK REVIEW

[論文レビュー] Covariate Microaggregation for Logistic Regression: An Application for Analysis of Confidential Data

Paramita Saha‐Chaudhuri|arXiv (Cornell University)|Mar 17, 2016
Privacy-Preserving Technologies in Data参考文献 22被引用数 3
ひとこと要約

本稿では、分散型健康データネットワークにおける二値疾患アウトカムを分析するためのプライバシー保護手法であるPooled Logistic Regression (PoLoR) を提案する。個々の被験者レベルの情報を暴露せずに、共変量をプールに微集計した上で集計レベルのデータを中央分析センターに共有することにより、オッズ比などのロジスティック回帰パラメータの一貫性のある推定が可能となる。この手法は標準的な統計ソフトウェアとの互換性を保ち、尤度比検定を用いたモデル選択も可能である。

ABSTRACT

In the recent past, electronic health records and distributed data networks emerged as a viable resource for medical and scientific research. As the use of confidential patient information from such sources become more common, maintaining privacy of patients is of utmost importance. For a binary disease outcome of interest, we show that the techniques of microaggregation (equivalent to specimen pooling) and \underline{Po}oled \underline{Lo}gistic \underline{R}egression (PoLoR) could be applied for analysis of large and/or distributed data while respecting patient privacy. PoLoR is exactly the same as standard logistic regression, but instead of using individual covariate level, the analysis uses microaggregated covariate level when microaggregation is conditional on the outcome status. Aggregate levels of covariates can be passed from the nodes of the network to the analysis center without revealing individual-level microdata and can be used very easily with standard softwares for estimation of disease odds ratio associated with a set of categorical or continuous covariates. Microaggregation of covariates allows for consistent estimation of the parameters of logistic regression model that can include confounders and transformation of exposure. Additionally, since the microdata can be accessed within nodes, effect modifiers can be accommodated and consistently estimated. For analysis of confidential health data, covariate microaggregation for logistic regression will provide a practical and straightforward alternative to more complicated existing options.

研究の動機と目的

  • 分散型健康データネットワークにおける機密性の高い患者データの分析に際し、患者のプライバシーを保護する挑戦に応えること。
  • 二値アウトカムを対象とするロジスティック回帰のための、複雑なプライバシー保護手法の実用的で計算効率の良い代替策を開発すること。
  • 個々の被験者レベルのデータを共有せずに、集計レベルの共変量のみを用いてオッズ比やモデルパラメータを推定できること。
  • データプライバシー制約がある中でも、馴染みのある統計ツールを用いてモデル選択と標準誤差推定を可能にすること。
  • 微集計による共変量処理が、大規模データ環境下でパラメータ推定の一貫性を維持するとともに、次元削減を実現することを示すこと。

提案手法

  • 各データノードで共変量の微集計が行われ、個々の被験者をサイズgのプールにグループ化し、集計レベルの共変量値を生成する。
  • ノード内での個々の被験者レベルのデータから導出されたプール化された共変量データが、中央分析センターに送信されるが、個々の記録は送信されない。
  • 集計レベルの共変量に基づいて標準的なロジスティック回帰モデルが適合され、これはPoLoRに相当し、一貫性のあるパラメータ推定をもたらす。
  • 本手法は連続的およびカテゴリカルな共変量の両方を扱い、変換や交絡要因の調整も可能である。
  • モデル選択と推論には標準的な尤度比検定およびロバスト標準誤差が用いられ、妥当性が保証される。
  • 本アプローチはスケーラブルであり、個々の被験者レベルのデータがノードから脱出しないようにすることでプライバシーを維持し、集計要約のみが交換される。

実験結果

リサーチクエスチョン

  • RQ1共変量の微集計により、個々の被験者レベルの情報を暴露せずに、分散型データネットワークにおけるロジスティック回帰パラメータの一貫性のある推定が可能か?
  • RQ2プールサイズgの選択が、PoLoRにおけるオッズ比推定のバイアスと精度にどのように影響するか?
  • RQ3PoLoRは、従来の統計ソフトウェアと手法を用いて、モデル選択と標準誤差推定を可能にするか?
  • RQ4PoLoRは連続的およびカテゴリカルな共変量(変換された露出要因や交絡要因を含む)の両方に対応可能か?
  • RQ5PoLoR推定量の漸近的性質は何か?また、これは被験者数ではなくプール数に依存するか?

主な発見

  • PoLoRは、個々の被験者レベルのデータではなく微集計された共変量レベルを用いることで、ロジスティック回帰係数およびオッズ比の一致した推定を実現する。
  • コロナがんデータセットにおいて、g = 3およびg = 4のプールサイズを用いたPoLoRは、標準的ロジスティック回帰とほぼ同一のログオッズ比推定値を示し、標準誤差の差はわずかであった。
  • 本手法はモデルの妥当性を維持しており、従来のソフトウェアを用いて尤度比検定と標準誤差推定が可能である。
  • プライバシー保護と推定バイアスの両者のバランスをとるには、プールサイズを5~20程度に設定することが妥当である。g > 40では、平均への回帰の影響によりバイアスが増加する。
  • 次元削減と一回の走査による推定が可能であるため、PoLoRは大規模データおよびリソース制約のある環境においてもスケーラブルで適している。
  • 本手法は繰り返し更新を想定していない。新しいレコードを追加するには、再プール化と再分析を完全に再実行する必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。