Skip to main content
QUICK REVIEW

[論文レビュー] U.S. Broadband Coverage Data Set: A Differentially Private Data Release

Mayana Pereira, Kim Allen|arXiv (Cornell University)|Mar 24, 2021
Privacy-Preserving Technologies in Data参考文献 7被引用数 5
ひとこと要約

本論文は、ラプラス機構によるノイズ注入を用いて個人のプライバシーを保護しながらも、一般公開が可能な米国ブロードバンドカバレッジデータセットを、郵便番号レベルで提示する。プライバシー損失の追加がないPost-processingシミュレーション手法を導入し、さまざまな人口規模における利用可能性の透明性を保証する。

ABSTRACT

Broadband connectivity is a key metric in today's economy. In an era of rapid expansion of the digital economy, it directly impacts GDP. Furthermore, with the COVID-19 guidelines of social distancing, internet connectivity became necessary to everyday activities such as work, learning, and staying in touch with family and friends. This paper introduces a publicly available U.S. Broadband Coverage data set that reports broadband coverage percentages at a zip code-level. We also explain how we used differential privacy to guarantee that the privacy of individual households is preserved. Our data set also contains error ranges estimates, providing information on the expected error introduced by differential privacy per zip code. We describe our error range calculation method and show that this additional data metric does not induce any privacy losses.

研究の動機と目的

  • 郵便番号レベルでのブロードバンドアクセスデータの公表におけるプライバシーと有用性のトレードオフを解決すること。
  • 個人の世帯レベルのプライバシーを保持しつつ、政策立案および研究用途に適したデータの有用性を維持する手法を開発すること。
  • 差分プライバシーの影響を定量化するために、各郵便番号に対して透明な誤差推定値を提供すること。
  • 誤差範囲推定がPost-processing免疫の特性により、追加のプライバシー損失を引き起こさないことを保証すること。
  • プライバシー保護型で公開可能なデータセットを活用し、公平なブロードバンド資金配分意思決定を支援すること。

提案手法

  • 匿名化されたマイクロソフトサービス利用データ(デバイスのスループット、ダウンロード時間、逆IPベースの郵便番号解釈)を用いて、ブロードバンドカバレッジ推定値を算出する。
  • 感度Δf = 1のカウントクエリ(例:郵便番号ごの高速接続数)に、スケールλ = 1/εを用いたラプラス機構を適用し、ε-差分プライバシーを達成する。
  • シミュレーションベースの誤差推定プロセスにより、各郵便番号について独立したk個の差分プライバシーを適用したカウント(H, M, O)のサンプルを生成し、スケール1/εの独立したラプラスノイズを用いる。
  • 各郵便番号について、ノイズを含むカウントから再計算されたブロードバンドカバレッジ推定値(BCE)と、真の(非プライベートな)BCEとの差を用いて、誤差指標を算出する。
  • 誤差指標(平均絶対誤差(MAE)、95パーセンタイル誤差、平均符号付き偏差(MSD))は、シミュレートされた誤差分布d^zから導出される。
  • すべての誤差範囲計算は、差分プライバシーを適用したカウントのみを用いたPost-processingで実施され、Post-processing免疫により追加のプライバシー損失が生じない。

実験結果

リサーチクエスチョン

  • RQ1個人の世帯レベルのプライバシーが保護される条件下で、どのようにして郵便番号レベルのブロードバンドカバレッジデータを公開できるか?
  • RQ2差分プライバシーの影響が、人口規模が異なる郵便番号におけるブロードバンドカバレッジ推定値の正確性にどのように現れるか?
  • RQ3追加のプライバシー損失を生じさせることなく、差分プライバシーを適用したデータの誤差範囲を推定できるか?
  • RQ4郵便番号の人口規模に応じて、ブロードバンドカバレッジ推定値の誤差はどのように変化するか?
  • RQ5差分プライバシーを適用したブロードバンドカバレッジデータセットは、政策立案および研究用途においてどの程度の有用性を有するか?

主な発見

  • 本ブロードバンドカバレッジデータセットは、ε-差分プライバシーを満たしており、個人の世帯データが再識別不能であることを保証する。
  • シミュレーションによる誤差範囲推定は、差分プライバシーのPost-processing免疫特性のおかげで、追加のプライバシー損失を生じさせない。
  • 平均絶対誤差(MAE)および95パーセンタイル誤差は、人口規模が大きくなるにつれて減少し、大規模な郵便番号での推定精度が向上していることが示された。
  • 平均符号付き偏差(MSD)は小さいため、差分プライバシー機構が平均的にほとんどバイアスを導入していないことが示された。
  • シミュレーションベースの誤差推定手法により、各郵便番号に対して信頼性が高く透明性のある誤差指標が提供され、ユーザーがデータの信頼性を評価できるようになった。
  • 本データセットはOpenDP SmartNoiseライブラリを介して公開されており、差分プライバシー実装の再現可能性と信頼性が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。