Skip to main content
QUICK REVIEW

[论文解读] Automated Detection of GDPR Disclosure Requirements in Privacy Policies using Deep Active Learning

Tamjid Al Rahat, Tu Le|arXiv (Cornell University)|Nov 8, 2021
Privacy, Security, and Data Protection参考文献 17被引用 4
一句话总结

本文提出了一种基于卷积神经网络(CNN)的深度主动学习方法,用于自动根据18项GDPR披露要求对隐私政策进行分类。该模型在新创建的1,080份标注隐私政策数据集上进行训练,取得了89.2%的准确率,并揭示尽管自2018年实施监管以来,仅有3%的网站完全符合GDPR披露要求。

ABSTRACT

Since GDPR came into force in May 2018, companies have worked on their data practices to comply with this privacy law. In particular, since the privacy policy is the essential communication channel for users to understand and control their privacy, many companies updated their privacy policies after GDPR was enforced. However, most privacy policies are verbose, full of jargon, and vaguely describe companies' data practices and users' rights. Therefore, it is unclear if they comply with GDPR. In this paper, we create a privacy policy dataset of 1,080 websites labeled with the 18 GDPR requirements and develop a Convolutional Neural Network (CNN) based model which can classify the privacy policies with an accuracy of 89.2%. We apply our model to perform a measurement on the compliance in the privacy policies. Our results show that even after GDPR went into effect, 97% of websites still fail to comply with at least one requirement of GDPR.

研究动机与目标

  • 调查自2018年GDPR实施以来,主要网站隐私政策对GDPR披露要求的符合程度。
  • 解决公开可用、高质量且以GDPR要求标注的隐私政策分析数据集匮乏的问题。
  • 开发一种自动、可扩展的方法,将隐私政策段落分类至特定的GDPR披露类别。
  • 通过基于池的主动学习,以较低成本提高模型准确率,减少标注工作量同时提升性能。
  • 为当前9,761个顶级网站隐私政策中GDPR合规性的现状提供实证证据。

提出的方法

  • 使用基于英国的VPN构建了包含9,761个网站的隐私政策语料库,以确保地理多样性与数据一致性。
  • 通过法律专家咨询确定了18项GDPR披露要求,并将其作为18个二值标签用于标注。
  • 使用训练有素的人工标注员对1,080份隐私政策进行标注,创建高质量、已标注的数据集用于模型训练。
  • 开发基于CNN的文本分类模型,将隐私政策段落映射至18项GDPR要求类别。
  • 应用基于池的主动学习,迭代选择最具信息量的未标注样本进行标注,以最小化标注工作量的同时提高模型准确率。
  • 使用最终模型对9,761个网站进行大规模合规性测量,评估各项GDPR要求的合规情况。

实验结果

研究问题

  • RQ1自2018年GDPR实施以来,顶级网站隐私政策对18项GDPR披露要求的符合程度如何?
  • RQ2基于CNN的模型在将隐私政策段落分类至特定GDPR披露类别方面效果如何?
  • RQ3主动学习能否在最小化标注成本的同时显著提升GDPR合规性分类器的性能?
  • RQ4哪些GDPR披露要求在隐私政策中最常被遗漏?各项要求的合规率分别是多少?
  • RQ5网站的合规水平整体分布如何?有多少网站完全符合全部18项要求?

主要发现

  • 基于CNN的模型准确率达到89.2%,平均F1值为0.88,通过主动学习相较初始模型实现了10.8%的相对性能提升。
  • 仅有3%的网站在其隐私政策中完全符合全部18项GDPR披露要求,表明存在广泛不合规现象。
  • 六项主要GDPR要求类别——如画像与自动化决策——仅在15.3%至20%的隐私政策中被披露。
  • 关于披露画像或自动化决策相关信息的要求最常被遗漏,仅有15.3%的网站进行了披露。
  • 总计97%的网站至少有一项GDPR披露要求未遵守,凸显隐私政策透明度方面存在系统性缺陷。
  • 本研究揭示了GDPR法律要求与实际隐私政策披露之间存在显著差距,即使在法规实施多年后依然如此。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。