Skip to main content
QUICK REVIEW

[論文レビュー] A Stackelberg Game Perspective on the Conflict Between Machine Learning and Data Obfuscation

Jeffrey Pawlick, Quanyan Zhu|arXiv (Cornell University)|Aug 8, 2016
Privacy-Preserving Technologies in Data参考文献 13被引用数 3
ひとこと要約

この論文は、機械学習者とデータを隠ぺいするユーザーの戦略的対立を、学習者が最初にプライバシー水準をコミットし、ユーザーがそれに応じて自身のデータにノイズを追加するN+1人プレイヤーのスタックルベルクゲームとしてモデル化する。主な発見は、学習者が自らも事前にデータを摺り減らすことで、ユーザーによるデータ隠ぺいの悪影響を緩和し、プライバシー保護を学習者にとってインcentive-compatibleにすることができるため、精度と有用性を向上させられることである。

ABSTRACT

Data is the new oil; this refrain is repeated extensively in the age of internet tracking, machine learning, and data analytics. As data collection becomes more personal and pervasive, however, public pressure is mounting for privacy protection. In this atmosphere, developers have created applications to add noise to user attributes visible to tracking algorithms. This creates a strategic interaction between trackers and users when incentives to maintain privacy and improve accuracy are misaligned. In this paper, we conceptualize this conflict through an N+1-player, augmented Stackelberg game. First a machine learner declares a privacy protection level, and then users respond by choosing their own perturbation amounts. We use the general frameworks of differential privacy and empirical risk minimization to quantify the utility components due to privacy and accuracy, respectively. In equilibrium, each user perturbs her data independently, which leads to a high net loss in accuracy. To remedy this scenario, we show that the learner improves his utility by proactively perturbing the data himself. While other work in this area has studied privacy markets and mechanism design for truthful reporting of user information, we take a different viewpoint by considering both user and learner perturbation.

研究の動機と目的

  • 機械学習者とプライバシーを重視してデータを隠ぺいするユーザーの戦略的相互作用をゲーム理論的問題としてモデル化すること。
  • 学習者が発表したプライバシー水準に応じて、ユーザーが自らのノイズ量を決定する際の均衡行動を分析すること。
  • この戦略的状況において、微分プライバシー(DP)によるプライバシー損失と、経験的リスク最小化(ERM)による精度の間のトレードオフを定量化すること。
  • 学習者がユーザーの隠ぺいに対抗して、自らも事前にデータを摺り減らすことで、自身の有用性を向上させられるかどうかを調査すること。
  • 事前の学習者による摺り減らしが、プライバシー保護を学習者にとってインセンティブに適合させ、全体の精度損失を低減できることを示すこと。

提案手法

  • 学習者をリーダー、N人のユーザーをフォロワーとするN+1人プレイヤーの拡張スタックルベルクゲームとして相互作用をモデル化する。
  • 微分プライバシー(DP)を用いてプライバシー損失を定量化し、パラメータεpで制御する。精度は経験的リスク最小化(ERM)で測定する。
  • 入力データに加えられる摺り減らしベクトルvi(ユーザー)とwi(学習者)を導入し、合計ノイズui = vi + wiとする。
  • L2正則化ERMと損失関数のリプシッツ連続性を用いて、元の分類器と摺り減らされた分類器の差の上限を導出する。
  • 集中不等式とカイ二乗尾部バウンドを用いて、ノイズによる期待損失差の確率的境界を求める。
  • 均衡条件を確立し、ユーザーの反応に応じた学習者の最適戦略を分析する。その結果、事前の摺り減らしがネット精度損失を低減できることを示す。

実験結果

リサーチクエスチョン

  • RQ1戦略的状況下で、ユーザーによるデータ隠ぺいは機械学習モデルの精度にどのように影響するか?
  • RQ2学習者が発表したプライバシー水準に応じて、ユーザーが独立して摺り減らし量を決定する際の均衡結果は何か?
  • RQ3ユーザーがすでに隠ぺいしている状況でも、機械学習者が自ら事前にデータを摺り減らすことで、自身の有用性を向上させられるか?
  • RQ4ユーザーが隠ぺいしている状況で、プライバシー保護が学習者にとってインセンティブに適合するのはどのような条件下か?
  • RQ5ユーザーと学習者の両方の摺り減らしが、学習システム全体の精度にどのように影響するか?

主な発見

  • 均衡状態では、ユーザーが独立してデータを摺り減らし、独立したノイズの蓄積によりモデル精度に顕著な損失が生じる。
  • ユーザーの隠ぺいにより、両者のノイズが重なってモデル性能が劣化するため、学習者の有用性が低下する。
  • 学習者が事前に摺り減らしを行うことで、訓練データ内の有効なノイズレベルを低下させ、ユーザーによる隠ぺいの悪影響を緩和できる。
  • ユーザーの隠ぺいが高コストである場合、学習者が自らデータを摺り減らすことで、より良い有用性を達成でき、プライバシー保護をインセンティブに適合させられる。
  • 理論的境界では、最適分類器と摺り減らされた分類器の期待損失差が、ノイズの大きさの二乗和に比例することが高確率で示された。
  • 分析により、学習者は過度なユーザーの隠ぺいを抑える戦略的摺り減らし量を選択することで、有利な均衡に到達できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。