Skip to main content
QUICK REVIEW

[論文レビュー] On the Unicity of Smartphone Applications

Jagdish Prasad Achara, Gergely Ács|arXiv (Cornell University)|Jul 28, 2015
Privacy, Security, and Data Protection参考文献 12被引用数 4
ひとこと要約

本論文は、スマートフォンのアプリリストが引き起こす再識別可能性リスクを調査し、54,893人のAndroidユーザーから構成されるデータセットにおいて、わずか4つのインストール済みアプリで95%のユーザーを一意に特定できることを示している。マルコフ連鎖モンテカルロ法(MCMC)と非線形回帰を用いて、アプリリストの高さの独自性を示し、匿名化の困難さを明らかにするとともに、第三者トラッキングライブラリと組み合わせた場合のデータ共有における深刻なプライバシーリスクを強調している。

ABSTRACT

Prior works have shown that the list of apps installed by a user reveal a lot about user interests and behavior. These works rely on the semantics of the installed apps and show that various user traits could be learnt automatically using off-the-shelf machine-learning techniques. In this work, we focus on the re-identifiability issue and thoroughly study the unicity of smartphone apps on a dataset containing 54,893 Android users collected over a period of 7 months. Our study finds that any 4 apps installed by a user are enough (more than 95% times) for the re-identification of the user in our dataset. As the complete list of installed apps is unique for 99% of the users in our dataset, it can be easily used to track/profile the users by a service such as Twitter that has access to the whole list of installed apps of users. As our analyzed dataset is small as compared to the total population of Android users, we also study how unicity would vary with larger datasets. This work emphasizes the need of better privacy guards against collection, use and release of the list of installed apps.

研究の動機と目的

  • スマートフォンのアプリリストの固有性と、ユーザーのデータセットにおける再識別可能性リスクを評価すること。
  • アプリリストを偽名化された形で公開しても、その固有性の度合いを、アプリのサブセットに対して測定することにより、プライバシーへの影響を評価すること。
  • MCMCサンプリングを用いて、任意のアプリサブセットに対して偏りのない固有性推定手法を開発すること。
  • 限られたデータセットサンプルに基づき、非線形回帰を用いて、より大きな集団における固有性を予測すること。
  • 本研究の結果が、例えばグローバルなAndroidユーザー集団のような大規模データセットへ一般化可能かどうかを評価すること。

提案手法

  • 本研究では、7か月間にわたり収集された54,893人のAndroidユーザーのアプリリストを含むデータセットを用い、プライバシー保護のためアプリ名はハッシュ化された形で特定されている。
  • 本研究では、マルコフ連鎖モンテカルロ(MCMC)法を用いて、アプリのサブセットを一様にサンプリングし、サイズKのサブセットがデータセット全体で一意である確率を推定している。
  • MCMCチェーンは高速混合性を示しており、データセットサイズとKに対して時間計算量が概ね線形となるため、固有性の推定が効率的かつ正確に行える。
  • 本研究では、データセットサイズと固有性の関係をモデル化するため、非線形回帰を用いて、より大きな集団における固有性を予測する関数を学習している。
  • 本研究では、別個の100万人のユーザーを含む移動性データセットを用いてモデルを検証し、徐々に大きなサブセットで学習させることで、予測精度を評価している。
(a) $K=5$
(a) $K=5$

実験結果

リサーチクエスチョン

  • RQ1スマートフォンアプリデータセットにおいて、ユーザーを一意に特定するために必要なインストール済みアプリの最小数は何か?
  • RQ2アプリリストの固有性はデータセットサイズにどのように応じて変化するか?また、小さなサンプルから、より大きな集団における固有性を予測できるか?
  • RQ3アプリリストの偽名化が、固有性の本質的特徴のため、ユーザーのプライバシー保護にどの程度失敗するか?
  • RQ4MCMCサンプリングは、データセット内の任意のアプリサブセットに対して、偏りのない固有性推定を提供できるか?
  • RQ5小さなデータセットに基づいて学習されたモデルは、はるかに大きな現実世界の集団における固有性をどの程度正確に予測できるか?

主な発見

  • データセット内の99%のユーザーが、インストール済みアプリのリストが一意であるため、全アプリリストは極めて特徴的であることが示された。
  • わずか4つのアプリが分かっているだけで、ユーザーの再識別確率が95%に達することから、強い再識別可能性リスクが明らかになった。
  • 2つのアプリさえ分かっていれば、攻撃者は75%の確率でユーザーを特定できることから、最小限の情報でもリスクが顕在化している。
  • MCMCに基づく手法は、任意のサブセットサイズKに対して偏りのない固有性推定を提供し、高速混合性の性質により高精度が保証されている。
  • 非線形回帰モデルは、十分に大きなサンプル(例:100,000人のユーザー)で学習された場合、100万人のユーザーを含むデータセットにおいても固有性をよく予測できる。平均誤差は0.05にとどまる。
  • 50,000人のユーザーでのみモデルを学習させた場合、一般化性能が著しく低下するため、小規模なデータセットは、グローバル規模の集団における固有性予測に代表的でない可能性がある。
(b) $K=6$
(b) $K=6$

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。