Skip to main content
QUICK REVIEW

[論文レビュー] AntShield: On-Device Detection of Personal Information Exposure

Anastasia Shuba, Evita Bakopoulou|arXiv (Cornell University)|Mar 3, 2018
Advanced Malware Detection Techniques参考文献 14被引用数 9
ひとこと要約

AntShield は、モバイルネットワークトラフィックにおける事前に定義されたおよび未知の個人識別情報(PII)漏洩をリアルタイムで検出する、画期的なオンデバイスシステムである。リアルタイムでの文字列照合とマルチラベル分類を統合し、モバイルデバイス上で高い精度(最先端技術比で8–25%の向上)とミリ秒未塔の性能(分類処理で約0.75 ms)を達成しており、リモートプロキシに依存せずにリアルタイムでのプライバシー保護を実現する。

ABSTRACT

Mobile devices have access to personal, potentially sensitive data, and there is a growing number of applications that transmit this personally identifiable information (PII) over the network. In this paper, we present the AntShield system that performs on-device packet-level monitoring and detects the transmission of such sensitive information accurately and in real-time. A key insight is to distinguish PII that is predefined and is easily available on the device from PII that is unknown a priori but can be automatically detected by classifiers. Our system not only combines, for the first time, the advantages of on-device monitoring with the power of learning unknown PII, but also outperforms either of the two approaches alone. We demonstrate the real-time performance of our prototype as well as the classification performance using a dataset that we collect and analyze from scratch (including new findings in terms of leaks and patterns). AntShield is a first step towards enabling distributed learning of private information exposure.

研究の動機と目的

  • モバイルネットワークトラフィックにおける事前定義済みおよび未知の PII 漏洩をリアルタイムでオンデバイスで検出するための課題に対処すること。
  • 分類に事前に定義されたブラックリストやリモートの信頼できるプロキシに依存する既存のシステムの制限を克服すること。
  • ユーザーのプライバシーとデバイスの自律性を保ちながら、正確で低オーバーヘッドの PII 暴露検出を可能にすること。
  • 以前に未知の漏洩パターンや行動を特定するための、包括的な新しいモバイル PII 漏洩データセットを収集・分析すること。
  • 複数のモバイルデバイスにまたがる分散型でプライバシーを守る学習による PII 漏洩の理解を基盤づけること。

提案手法

  • 事前に定義された PII の検出のために、リアルタイムパケットインターセプトと Aho-Corasick 文字列照合を実行する AntMonitor ライブラリを使用する。
  • 未知の PII を検出するために、決定木を用いた Binary Relevance フレームワークに基づくマルチラベル分類フレームワークを採用する。
  • スケーラビリティと遅延の低減を図りながらも精度を維持するため、ドメインごとの分類ではなくアプリケーションごとの分類器を設計する。
  • 効率的な文字列パースと Aho-Corasick 検索を用いて特徴抽出を最適化し、特徴抽出時間を 0.107 ms ± 0.149 ms に短縮する。
  • 分類遅延が 0.751 ms ± 1.35 ms にとどまる軽量でオンデバイスの推論を実装し、リアルタイム動作を可能にする。
  • 将来のフェデレーテッドラーニングやプライバシー保護型協調学習フレームワークとの統合をサポートし、分散型モデル学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1事前に定義されたおよび未知の PII のオンデバイス検出を、高い精度と低いパフォーマンスオーバーヘッドで達成できるか?
  • RQ2文字列照合とマルチラベル分類をハイブリッドで組み合わせたアプローチが、既存の手法に比べて PII 漏洩検出においてどのように優れているか?
  • RQ3モバイルネットワークトラフィックにおける PII を含む実世界の漏洩パターンや、以前に未知であった漏洩行動は何か?
  • RQ4アプリケーションごとの分類器は、ドメインごとの分類器と同等の精度を達成しつつ、より高速でスケーラブルな検出を可能にするか?
  • RQ5リモートインfraに依存せずに、モバイルデバイス上でリアルタイムに機械学習モデルをトレーニングおよびデプロイすることは可能か?

主な発見

  • AntShield システムは、Recon や他の最先端技術と比較して、分類精度が 8–25% 高く、分散度が 2–5 倍低い。
  • Aho-Corasick を用いた特徴抽出により、遅延が 0.107 ms ± 0.149 ms に短縮され、Java 文字列パースを用いた Recon の 36 ms ± 17 ms と比べ顕著な改善が得られた。
  • マルチラベル分類は 1 パケットあたり 0.751 ms ± 1.35 ms で実行され、ユーザーに顕著な影響を与えず、モバイルデバイス上でリアルタイム検出が可能となった。
  • 収集したデータセットから、平文の TCP や UDP を介した PII 漏洩、バックグラウンドアプリケーションによる送信、Root 機器向けのスキャン攻撃といった新たな漏洩パターンが明らかになった。
  • アプリケーションごとの分類器は、ドメインごとの分類器と同等の精度を達成しながら、より高速でスケーラブルな動作と広範なトラフィックカバレッジを実現した。
  • 一般分類器のトレーニング時間は最大数十分にのぼるが、トレーニングは稀に限られ、リモートで実施できるため、デプロイに支障をきたさない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。