Skip to main content
QUICK REVIEW

[論文レビュー] Social Media and User Privacy

Ghazaleh Beigi|arXiv (Cornell University)|Jun 26, 2018
Privacy-Preserving Technologies in Data参考文献 6被引用数 9
ひとこと要約

本論文は、ターゲットユーザーの事前知識を必要とせず、構造的要因とテキスト的要因の間の隠れた関係を利用する、ソーシャルメディアデータに対する画期的な敵対的脱匿名化攻撃を提案する。tf-idfに基づく投稿分析、APIを用いたプロファイル検索、構造的およびテキスト的特徴を用いた類似度スコアリングを組み合わせることで、両方の要因が完全に匿名化された後でもユーザーの再特定が成功し、現在の独立した匿名化戦略が、異種要因間のデータ漏洩によって不十分であることが明らかになった。

ABSTRACT

Online users generate tremendous amounts of data. To better serve users, it is required to share the user-related data among researchers, advertisers and application developers. Publishing such data would raise more concerns on user privacy. To encourage data sharing and mitigate user privacy concerns, a number of anonymization and de-anonymization algorithms have been developed to help protect privacy of users. This paper reviews my doctoral research on online users privacy specifically in social media. In particular, I propose a new adversarial attack specialized for social media data. I further provide a principled way to assess effectiveness of anonymizing different aspects of social media data. My work sheds light on new privacy risks in social media data due to innate heterogeneity of user-generated data.

研究の動機と目的

  • テキストや構造のいずれかの要因にのみ匿名化を施すことが、ユーザーのプライバシー保護に十分であるかどうかを調査すること。
  • 構造的およびテキスト的両要因を完全に匿名化することによって、脱匿名化が防げることかどうかを評価すること。
  • ソーシャルメディアにおける異種データ要因間の潜在的関係から生じる隠れたプライバシーリスクを特定すること。
  • 公開APIおよびユーザー生成コンテンツを活用して、知識を必要としない実用的な敵対的脱匿名化攻撃を開発すること。
  • 現在の独立した匿名化の仮定の限界を明らかにすることで、将来のプライバシー保護データ公開技術の設計を支援すること。

提案手法

  • tf-idfスコアを用いて、匿名化済みデータ内のユーザーの最も情報量の多いテキスト的内容(上位-k件の投稿)を抽出する。
  • 抽出されたテキスト的内容を用いて、公開のソーシャルメディアAPI(例:Twitter、Foursquare)に照会し、候補となるユーザーのプロファイルを取得する。
  • 投稿のテキスト的ベクトルと、近隣ノードの次数分布などの構造的特徴を組み合わせた特徴を用いて、匿名化済みユーザーと各候補との類似度を計算する。
  • 類似度の高い候補の周辺ノードの特徴を統合することで、脱匿名化の正確性を向上させ、匿名化の有効性を低下させる。
  • テキスト的および構造的特徴を統合した類似度スコアリング関数を用いて候補をランク付けし、最も可能性の高いマッチングを特定する。
  • 実世界のデータセット(TwitterおよびFoursquare)を用いて攻撃を実装・評価し、匿名化の耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1テキストまたは構造のどちらか一方の要因のみを匿名化した場合、データはプライベートであると言えるか?
  • RQ2ケース4—構造的およびテキスト的両要因を完全に匿名化した場合—は、ソーシャルメディアデータにおけるユーザーのプライバシー保護に十分であるか?
  • RQ3異種ソーシャルメディアデータにおける異なるデータ要因間の隠れた関係は、完全匿名化後でさえプライバシー漏洩を引き起こす可能性があるか?
  • RQ4知識を必要としない敵対的攻撃が、公開APIおよびユーザー生成コンテンツのみを用いて、どの程度ユーザーを再特定できるか?
  • RQ5類似ユーザーの周辺ノードの特徴を組み込むことで、匿名化済みソーシャルメディアデータに対する脱匿名化攻撃の有効性はどの程度向上するか?

主な発見

  • 提案された敵対的攻撃は、構造的およびテキスト的両要因が完全に匿名化された状態でも、匿名化済みソーシャルメディアデータ内のユーザーを成功裏に再特定した。
  • データ要因を独立して匿名化することは不十分であり、隠れたクロスアスペクト関係が脱匿名化攻撃を可能にしている。
  • 攻撃はターゲットユーザーの事前知識や背景情報が不要であり、公開APIおよびユーザー生成コンテンツのみに依存している。
  • 類似ユーザーの周辺ノードの特徴を統合することで、脱匿名化の正確性が顕著に向上し、匿名化の有効性が著しく低下した。
  • 攻撃は、データの多様性に起因する、現在の匿名化手法が、高度なAPI駆動型脱匿名化攻撃に対して脆弱であることを示した。
  • TwitterおよびFoursquareデータセットを用いた評価により、完全匿名化がプライバシーを保証するわけではないことが確認され、現在のプライバシー保護技術における深刻なギャップが露呈された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。