Skip to main content
QUICK REVIEW

[論文レビュー] Toward the Cure of Privacy Policy Reading Phobia: Automated Generation of Privacy Nutrition Labels From Privacy Policies

Shidong Pan, Thong Hoang|arXiv (Cornell University)|Jun 19, 2023
Privacy, Security, and Data Protection被引用数 6
ひとこと要約

本論文は、大規模言語モデルと構造化プロンプトを用いて、プライバシーポリシーから自動的にプライバシー栄養標識を生成する最初のフレームワークを提案する。最初のプライマリデータ収集に関して0.75のF1スコアを達成し、未申告の実践の90.1%を同定する。これは『プライバシーポリシー読解恐怖症』を是正し、ユーザーの透明性を向上させるスケーラブルなソリューションを提供する。

ABSTRACT

Software applications have become an omnipresent part of modern society. The consequent privacy policies of these applications play a significant role in informing customers how their personal information is collected, stored, and used. However, customers rarely read and often fail to understand privacy policies because of the ``Privacy Policy Reading Phobia'' (PPRP). To tackle this emerging challenge, we propose the first framework that can automatically generate privacy nutrition labels from privacy policies. Based on our ground truth applications about the Data Safety Report from the Google Play app store, our framework achieves a 0.75 F1-score on generating first-party data collection practices and an average of 0.93 F1-score on general security practices. We also analyse the inconsistencies between ground truth and curated privacy nutrition labels on the market, and our framework can detect 90.1% under-claim issues. Our framework demonstrates decent generalizability across different privacy nutrition label formats, such as Google's Data Safety Report and Apple's App Privacy Details.

研究の動機と目的

  • ユーザーが長く複雑なプライバシーポリシーを読んだり理解できなかったりする広範な『プライバシーポリシー読解恐怖症』(PPRP)に対処すること。
  • 既存のプライバシーポリシーと、GoogleプレイやApple App Storeなどのアプリストアで新たに義務付けられているプライバシー栄養標識形式の間のギャップを埋めること。
  • 非構造的なプライバシーポリシーを構造的でユーザーフレンドリーなプライバシー栄養標識に変換する自動化システムを開発すること。
  • データ実践の要約を簡潔に、標準化し、機械で読み取り可能な形にすることで、透明性を向上させ、ユーザーの信頼を高めること。

提案手法

  • 大規模言語モデル(LLMs)を活用し、プライバシーポリシーからデータ収集および使用実践を抽出・分類する。
  • 2段階のプロンプト戦略を設計:まず、生のデータ実践を抽出;次に、それらを標準化されたプライバシー標識カテゴリにマッピング。
  • few-shotプロンプトとチェーン・オブ・チニンク(思考の連鎖)推論を用いて微調整されたLLMsを適用し、分類の正確性を向上。
  • ラベル生成に、GoogleのデータセーフティレポートおよびAppleのアプリプライバシー詳細フォーマットに一致する構造化テンプレートを適用。
  • 不正な記載(特に未申告)を特定するため、真の値とキュレート済みラベルの間に一貫性のない点を検出するモジュールを実装。
  • 最初のプライマリデータ収集、第三者データ共有、一般セキュリティ実践の各分野でF1スコアを用いて性能を評価。
Figure 1 . The left image is a nutrition facts label format published by the U.S. Food & Drug Administration in 2016 (foo, 2016 ) . The middle and right images are screenshots of privacy nutrition labels from the Google Play app store (goo, 2022 ) and Apple App Store (app, 2022a ) , respectively.
Figure 1 . The left image is a nutrition facts label format published by the U.S. Food & Drug Administration in 2016 (foo, 2016 ) . The middle and right images are screenshots of privacy nutrition labels from the Google Play app store (goo, 2022 ) and Apple App Store (app, 2022a ) , respectively.

実験結果

リサーチクエスチョン

  • RQ1LLMベースのフレームワークは、非構造的なプライバシーポリシーから、標準化されたプライバシー栄養標識にデータ収集実践を正確に抽出・構造化できるか?
  • RQ2GoogleのデータセーフティレポートおよびAppleのアプリプライバシー詳細などの異なるプライバシー標識フォーマットに、このフレームワークはどれほど一般化できるか?
  • RQ3特に未申告のデータ実践を同定する際の主な失敗モードは何か、それらがフレームワークのパフォーマンスに与える影響は?
  • RQ4ハイブリッドプロンプトとルールベースのコンponentsと比較して、完全にLLMベースの設計がパフォーマンスにどれほど向上効果をもたらすか?
  • RQ5真のデータ実践とキュレート済みプライバシー標識に記載された内容との不一致を、このフレームワークはどれほど効果的に同定できるか?

主な発見

  • フレームワークは、最初のプライマリデータ収集実践の生成において0.75のF1スコアを達成し、コアタスクにおいて優れたパフォーマンスを示している。
  • 一般セキュリティ実践では平均F1スコアが0.93に達し、これらの構造化フィールドに対する高い信頼性を示している。
  • 真の値と比較して、未申告のデータ実践の90.1%を同定できたため、欠落の同定に特に有効であることが示された。
  • 第三者データ共有のパフォーマンスは0.63のF1スコアにとどまり、グループ固有の条項やオムニバス型データタイプの曖昧さが主な要因である。
  • 完全にLLMベースの設計にすることで、第三者データ共有のF1スコアは13.1%向上したが、コストは約5倍に増加し、最初のプライマリデータでは顕著な向上は得られなかった。
  • Appleのアプリプライバシー詳細に対しても、フレームワークは妥当に一般化でき、全カテゴリで平均F1スコア0.70を達成した。
Figure 2 . An overview framework for generating privacy nutrition labels from privacy policies.
Figure 2 . An overview framework for generating privacy nutrition labels from privacy policies.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。