Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the protection provided by misclassification-based disclosure limitation methods for survey microdata

Natalie Shlomo, C. J. Skinner|London School of Economics and Political Science Research Online (London School of Economics and Political Science)|Nov 12, 2010
Healthcare Policy and Management被引用数 4
ひとこと要約

本稿では、データ交換やポストランダマイゼーション(PRAM)などの誤分類に基づく統計的機微情報漏洩防止(SDL)手法によって保護された調査マイクロデータにおける漏洩リスクを簡素化され実用的な方法で評価する手法を開発する。誤分類の影響を考慮するようにポisson対数線形モデルを拡張することで、現実の測定誤差や標本誤差を反映した正確なリスク推定が可能となり、誤分類の影響により、識別変数の数を増やすと逆にリスクが低下するという逆説的な結果が示された。

ABSTRACT

Government statistical agencies often apply statistical disclosure limitation techniques to survey microdata to protect the confidentiality of respondents. There is a need for valid and practical ways to assess the protection provided. This paper develops some simple methods for disclosure limitation techniques which perturb the values of categorical identifying variables. The methods are applied in numerical experiments based upon census data from the United Kingdom which are subject to two perturbation techniques: data swapping (random and targeted) and the post randomization method. Some simplifying approximations to the measure of risk are found to work well in capturing the impacts of these techniques. These approximations provide simple extensions of existing risk assessment methods based upon Poisson log-linear models. A numerical experiment is also undertaken to assess the impact of multivariate misclassification with an increasing number of identifying variables. It is found that the misclassification dominates the usual monotone increasing relationship between this number and risk so that the risk eventually declines, implying less sensitivity of risk to choice of identifying variables. The methods developed in this paper may also be used to obtain more realistic assessments of risk which take account of the kinds of measurement and other nonsampling errors commonly arising in surveys.

研究の動機と目的

  • 誤分類に基づくSDL手法(例:データ交換、PRAM)で保護されたマイクロデータにおける漏洩リスクを評価するための実用的で計算が単純な手法を開発すること。
  • ポisson対数線形モデルに基づく既存のリスク評価手法を、データ交換やPRAMのような摂動型SDL手法に対応させるように拡張すること。
  • 測定誤差や標本変動が、現実の調査状況を反映した形で漏洩リスクに与える影響を評価すること。
  • 誤分類の下で、カテゴリカルな識別変数の数の増加が識別リスクに与える感度を調査すること。
  • 機関がマイクロデータ公開時にデータ利用価値と機微情報保護のバランスをとるためのフレームワークを提供すること。

提案手法

  • 確率的レコードリンケージフレームワークから導出された、観測値が与えられたもとでの正確なマッチングの条件付き確率に基づくリスク指標を提案する。
  • 正確なリスク式の簡略化のための大標本近似を用い、閉形式の式を得る:φj ≈ Mjj / F̃j、ここでMjjは誤分類行列の対角成分、F̃jは外部データベースにおける期待周辺度数である。
  • UKセンサスデータを用いて、さまざまな設定下でのランダムおよび標的データ交換、PRAMをテストする。
  • 摂動効果を組み込むためにポisson対数線形モデルを拡張し、コード化や補完などの非標本誤差を考慮したリスク評価を可能にする。
  • 数値実験を用いて、識別変数の数を増やした場合のリスクを評価し、誤分類あり・なしの状況を比較する。
  • レコードリンケージ実験を用いて近似の妥当性を検証し、既存手法と比較することで、より現実的で正確な結果であることを示した。

実験結果

リサーチクエスチョン

  • RQ1データ交換やPRAMなどの誤分類に基づくSDL手法で保護されたマイクロデータにおける漏洩リスクを、どのように正確に評価できるか?
  • RQ2リスク指標に対する簡略化された近似は、計算の実行可能性を高める一方で、正確性をどれほど保持できるか?
  • RQ3誤分類機構に測定誤差や処理誤差を組み込むと、リスク推定値にどのような影響を与えるか?
  • RQ4誤分類が存在する状況で、識別変数の数を増やすと漏洩リスクにどのような影響を与えるか?
  • RQ5提案手法は、摂動や非標本誤差を無視する従来のアプローチよりも、より現実的なリスク評価を可能にするか?

主な発見

  • 提案された近似式 φj ≈ Mjj / F̃j は、複雑な摂動機構下でも、非常に正確かつ計算が高速な識別リスク推定を提供する。
  • 本手法はポisson対数線形モデルをSDL摂動に対応させる形で成功裏に拡張し、標本誤差や測定誤差を考慮したリスク評価を可能にした。
  • 標的データ交換は、同じ摂動レベル下でランダム交換よりも強い漏洩保護を提供することが判明し、利用価値とリスクのトレードオフが改善された。
  • 識別変数の数が増加するにつれ、誤分類の影響が通常のリスク上昇の単調性を上回り、リスクが最終的に低下するという、直感に反するがデータ保護にとって有益な結果が得られた。
  • 誤分類が存在する場合、重要な変数の選択に関する仮定への感度が低下し、実務においてより高いロバスト性が示された。
  • 本フレームワークにより、機関はデータ公開前に、コード化誤差や補完といった現実のデータ品質問題を現実的に組み込んだ形でリスクを評価できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。