[论文解读] Toward the Cure of Privacy Policy Reading Phobia: Automated Generation of Privacy Nutrition Labels From Privacy Policies
本文提出了首个利用大语言模型和结构化提示技术,从隐私政策自动生成隐私营养标签的框架。该框架在第一方数据收集任务上实现了0.75的F1分数,并检测到90.1%的被遗漏声明的数据实践,为应对‘隐私政策阅读恐惧症’提供了可扩展的解决方案,提升了用户透明度。
Software applications have become an omnipresent part of modern society. The consequent privacy policies of these applications play a significant role in informing customers how their personal information is collected, stored, and used. However, customers rarely read and often fail to understand privacy policies because of the ``Privacy Policy Reading Phobia'' (PPRP). To tackle this emerging challenge, we propose the first framework that can automatically generate privacy nutrition labels from privacy policies. Based on our ground truth applications about the Data Safety Report from the Google Play app store, our framework achieves a 0.75 F1-score on generating first-party data collection practices and an average of 0.93 F1-score on general security practices. We also analyse the inconsistencies between ground truth and curated privacy nutrition labels on the market, and our framework can detect 90.1% under-claim issues. Our framework demonstrates decent generalizability across different privacy nutrition label formats, such as Google's Data Safety Report and Apple's App Privacy Details.
研究动机与目标
- 解决用户因隐私政策冗长复杂而无法阅读或理解的广泛‘隐私政策阅读恐惧症’(PPRP)问题。
- 弥合现有隐私政策与应用商店(如Google Play和Apple App Store)新规定的隐私营养标签格式之间的差距。
- 开发一种自动化系统,将非结构化的隐私政策转换为结构化、用户友好的隐私营养标签。
- 通过提供简洁、标准化且机器可读的数据实践摘要,提升透明度和用户信任。
提出的方法
- 利用大语言模型(LLMs)从隐私政策中提取并分类数据收集与使用实践。
- 设计两阶段提示策略:第一阶段提取原始数据实践;第二阶段将其映射到标准化的隐私标签类别。
- 使用微调后的LLM结合 few-shot 提示和思维链推理,以提高分类准确性。
- 采用与Google的Data Safety Report和Apple的App Privacy Details格式对齐的结构化模板进行标签生成。
- 实施一致性检查模块,检测真实情况与整理后标签之间的差异,重点关注被遗漏的声明。
- 通过第一方数据收集、第三方数据共享以及通用安全实践的F1分数评估性能。

实验结果
研究问题
- RQ1基于LLM的框架能否准确地从非结构化隐私政策中提取并结构化数据收集实践,生成标准化的隐私营养标签?
- RQ2该框架在不同隐私标签格式(如Google的Data Safety Report和Apple的App Privacy Details)上的泛化能力如何?
- RQ3影响框架性能的主要失败模式是什么,特别是在检测被遗漏的数据实践方面?
- RQ4与混合提示和基于规则的组件相比,完全基于LLM的设计在性能上提升了多少?
- RQ5该框架在识别真实数据实践与整理后隐私标签之间不一致方面的有效性如何?
主要发现
- 该框架在生成第一方数据收集实践任务上实现了0.75的F1分数,表明在核心任务上表现优异。
- 在通用安全实践上的平均F1分数达到0.93,表明这些结构化字段具有高度可靠性。
- 与真实情况对比,该框架检测到90.1%的被遗漏数据实践,凸显其在识别遗漏方面的有效性。
- 在第三方数据共享任务上的F1分数较低,为0.63,主要由于特定群体条款和汇总型数据类型的模糊性。
- 完全基于LLM的设计使第三方数据共享的F1分数提升了13.1%,但成本增加约五倍,且在第一方数据任务上未带来显著提升。
- 该框架在Apple的App Privacy Details格式上也表现出合理的泛化能力,所有类别上的平均F1分数为0.70。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。