Skip to main content
QUICK REVIEW

[論文レビュー] Automated Approach to Improve IoT Privacy Policies

Parvaneh Shayegh, Vijayanta Jain|arXiv (Cornell University)|Oct 6, 2019
Privacy, Security, and Data Protection参考文献 18被引用数 4
ひとこと要約

本論文では、自然言語処理と教師あり機械学習、トピックモデリングを用いて、IoTのプライバシーポリシーを分析・短縮・構造化する自動化手法を提案する。主なトピックとして、データ収集、目的、許可などを特定し、ポリシー内容を可視化することで、ユーザーの理解を促進するとともに、実際のデバイス動作との不一致を特定する。

ABSTRACT

The massive growth of the Internet of Things (IoT) as a network of interconnected entities [18], brings up new challenges in terms of privacy and security requirements to the traditional software engineering domain [4]. To protect the individuals' privacy, the FTC's Fair Information Practice Principles (FIPPs) [6] proposes to companies to give notice to the consumer about their data practices, provide them with choices and give them means to have control over their own data.. Using privacy policy is the most common way for this type of notices. However, privacy policies are not generally effective due to two main reasons: first, privacy policies are long and full of legal jargon which are not understandable by a normal user; second, it is not guaranteed that an IoT device behave as it is explained in its privacy policy. In this technical report, we propose and discuss our methodologies to analyze privacy policies. By the help of this analysis, we reduce the length of a privacy policy and make it organized based on privacy practices to improve understanding level for the user. We also come up with a method to find the inconsistencies between IoT devices and their privacy policies.

研究の動機と目的

  • ユーザーが無視しがちな長く複雑なIoTプライバシーポリシーの読みやすさと効果性の低さを是正すること。
  • 現在の実務における重大なギャップである、IoTデバイスの動作とその記載されたプライバシーポリシーとの不一致を特定すること。
  • データ収集、目的、許可などのトピック別カテゴリに構造化することで、プライバシーポリシーの理解を向上させること。
  • デバイスコードがそのプライバシーポリシーに準拠しているかどうかを検証する自動ツールの基盤を構築すること。
  • ポリシー分析と可視化を通じて、IoTエコシステムにおけるより透明性があり信頼できるデータ実務を実現すること。

提案手法

  • ナイーブベイズ、SVM、ロジスティック回帰といった教師あり機械学習分類器を用い、情報、収集、目的、許可、技術などの事前に定義されたトピックにプライバシーポリシー文を分類する。
  • キーワードベースのテンプレートを用いたトピックモデリングを実装し、各トピックを代表語の集合(例:収集の場合は「収集」「使用」「共有」)で定義する。
  • ストップワードの除去と頻出語の保持により次元削減を実施する特徴選択プロセスを導入し、分類の効率性を向上させる。
  • 文単位でのトピックラベル付けを適用し、構造的で分類されたプライバシーポリシーを生成することで、トピックと機密性の高い用語を結ぶグラフとしてデータ実務を可視化する。
  • 分類済みで短縮されたポリシー出力を用いて、ポリシーの主張と実際のデバイス動作との乖離を特定し、特にデバイス間のデータフローにおいて顕著な不一致を特定する。
  • 147台のIoTデバイスおよびモバイルアプリから得られた既存のアノテート済みデータセットを活用し、分類モデルの学習と評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、重要なプライバシー情報の保持を前提に、プライバシーポリシーを自動的に分析・短縮できるか?
  • RQ2ナイーブベイズ、SVM、ロジスティック回帰のうち、どの機械学習分類手法がトピックごとの文分類において最高の正確性(精度)を達成するか?
  • RQ3トピックモデリングは、ユーザー理解を向上させるために、プライバシーポリシーの明確性と構造的整合性をどの程度向上させられるか?
  • RQ4IoTデバイスのコードとそのプライバシーポリシーとの不一致をどのように検出し、是正できるか?
  • RQ5ストップワードの除去やテキスト長の短縮を行う際、現在のアプローチには意味の保持にどのような限界があるか?

主な発見

  • 提案手法により、不要な文の削除を伴い、プライバシーポリシーの長さが著しく短縮され、読みやすさとユーザーのアクセス性が向上した。
  • トピックモデリングの結果、プライバシーポリシーにおいて「情報」が最も頻出するトピックであった一方で、「許可」はしばしば欠落しており、ユーザーの同意の伝達にギャップがあることが示された。
  • テストされた3つの分類器の中で、ロジスティック回帰が最も高い精度を示し、ナイーブベイズとSVMを上回った。
  • ポリシー内容をグラフモデルとして可視化することで、データ実務、機密性の高い用語、ポリシーのトピックとの関係が明確に示され、透明性が向上した。
  • 分析の結果、多くのプライバシーポリシーが、第三者へのアクセスやデータ保持期間に関して、明確さに欠けていることが判明した。
  • 本研究では、現在のデータセットが規模に制限があることが判明しており、今後の研究では、プライバシーポリシーの自動抽出を活用して、本手法のスケーラビリティを高める必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。