Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of per-record identification risk and swappability of records in a microdata set via decomposable models

Akimichi Takemura, Yushi Endo|ArXiv.org|Mar 27, 2006
Privacy-Preserving Technologies in Data参考文献 10被引用数 4
ひとこと要約

本稿では、分解可能対数線形モデルを用いて、マイクロデータにおけるレコードごとの識別リスクを体系的に評価し、安全なレコード交換を可能にする手法を提案する。多方向クロス集計表にAIC最適化の分解可能モデルを適合させることで、推定セル確率が低い(まれな)レコードを特定し、モデルの周辺分布を保つ交換を可能にする。これにより、開示制御を実施しつつ統計的推論を歪めない。

ABSTRACT

We propose a strategy for disclosure risk evaluation and disclosure control of a microdata set based on fitting decomposable models of a multiway contingency table corresponding to the microdata set. By fitting decomposable models, we can evaluate per-record identification (or re-identification) risk of a microdata set. Furthermore we can easily determine swappability of risky records which does not disturb the set of marginals of the decomposable model. Use of decomposable models has been already considered in the existing literature. The contribution of this paper is to propose a systematic strategy to the problem of finding a model with a good fit, identifying risky records under the model, and then applying the swapping procedure to these records.

研究の動機と目的

  • 統計的モデリングを用いて、マイクロデータセットにおけるレコードごとの識別リスクを体系的に評価する手法の開発。
  • 主要変数における希少な組み合わせを持つレコードが再識別リスクに晒されていることを特定する。
  • 適合された分解可能モデルの十分統計量を保つレコード交換による開示制御を可能にする。
  • 公式統計で一般的な大規模かつスパースなクロス集計表に対して、計算的に実行可能な手法を提供する。
  • 交換がモデルの周辺分布を変化させず、統計的妥当性を保つようにする。

提案手法

  • マイクロデータの主要変数から導出された多方向クロス集計表に、AICを用いたモデル選択による分解可能対数線形モデルを適合させる。
  • モデルの数が多すぎて探索不能な場合(例:8変数で3000万以上)、局所的最適な分解可能モデルを探索するアルゴリズムを用いる。
  • 各レコードのセル確率を推定し、特に推定確率が極めて低い(サンプル固有の)レコードを高リスク事例として焦点化する。
  • 分解可能モデルのクリークに対応する周辺分布の集合を保つように、交換手順を適用する。
  • Takemura & Hara (2002) が提示した必要十分条件を用い、モデルの十分統計量に影響を与えないようにレコードを交換可能かどうかを判断する。
  • 各高リスクレコードについて、最小頂点分離集合の値を共有しながら、クリークの値が異なるレコードを候補交換相手として探索する。

実験結果

リサーチクエスチョン

  • RQ1多くの主要変数を有する大規模かつスパースなマイクロデータセットにおいて、どのようにしてレコードごとの識別リスクを体系的に評価できるか?
  • RQ2クロス集計表におけるセル確率に基づき、再識別リスクが極めて高いレコードを特定する効果的かつ計算的に実行可能な手法は何か?
  • RQ3統計モデルの十分統計量を保ちつつ、データの有用性を損なわずにレコード交換を実行する方法は何か?
  • RQ4反復的推定手順に依存せずに、分解可能モデルを用いてマイクロデータの開示リスクを効率的に同定・制御できるか?
  • RQ52つのレコードを交換しても、適合された分解可能モデルの周辺分布が変化しないための条件は何か?

主な発見

  • 提案手法は、推定セル確率が10⁻⁸未満の50件のサンプル固有レコード(最も稀な2件を含む)を正常に同定し、交換を可能にした。
  • 局所的最適な分解可能モデルを探索するアルゴリズムは、膨大なモデル空間(例:8変数で3000万以上)を効率的に探索でき、計算上の実行可能性を確保した。
  • 共通の分離集合値を共有し、クリークの値が異なる(条件6)という基準に基づく交換は、多数の高リスクレコードに対して効果的かつ迅速に有効な交換相手を同定できた。
  • 分解可能モデルにより、セル確率の明示的かつ反復的でない推定が可能となり、希少セルリスクの正確な評価に不可欠であった。
  • AICを用いたモデル選択は、スパースかつ大標本設定における理論的限界が存在するが、実用的かつある程度効果的な基準を提供した。
  • 本手法はモデルの十分統計量を保ち続けるため、開示制御後も統計的推論の妥当性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。