Skip to main content
QUICK REVIEW

[论文解读] Modeling Language Vagueness in Privacy Policies using Deep Neural Networks

Fei Liu, Nicole Lee Fella|arXiv (Cornell University)|May 25, 2018
Internet Traffic Analysis and Secure E-voting参考文献 27被引用 8
一句话总结

本文提出一种深度学习方法,通过使用双任务神经网络学习词的稠密向量表示,来建模网站隐私政策中的语言模糊性。该方法联合预测下一个词并分类模糊术语,利用LSTMVis可视化学习到的表示,以发现语义和句法上相关的模糊表达,展示了其在识别隐私文本中细微语言模式方面的潜力。

ABSTRACT

Website privacy policies are too long to read and difficult to understand. The over-sophisticated language makes privacy notices to be less effective than they should be. People become even less willing to share their personal information when they perceive the privacy policy as vague. This paper focuses on decoding vagueness from a natural language processing perspective. While thoroughly identifying the vague terms and their linguistic scope remains an elusive challenge, in this work we seek to learn vector representations of words in privacy policies using deep neural networks. The vector representations are fed to an interactive visualization tool (LSTMVis) to test on their ability to discover syntactically and semantically related vague terms. The approach holds promise for modeling and understanding language vagueness.

研究动机与目标

  • 为解决隐私政策中语言模糊性带来的用户理解与信任问题。
  • 开发一种计算方法,利用深度神经网络识别并建模隐私政策语言中的模糊术语。
  • 探究学习到的词向量表示是否能捕捉在受控领域中与模糊性相关的语义和句法模式。
  • 通过可视化模糊术语的向量表示,使研究人员能够对隐私政策进行知识发现。

提出的方法

  • 训练一个深度神经网络,联合预测上下文中的下一个词,并基于预定义的40个模糊术语列表,将词分类为模糊或非模糊。
  • 通过迭代过程学习词嵌入,以优化在下一个词预测和模糊术语分类任务上的性能。
  • 使用LSTMVis对200维的向量表示进行可视化,LSTMVis是一种用于探索循环神经网络隐藏状态动态的交互式工具。
  • 可视化界面允许用户选择短语,并识别该短语及其上下文之间共享的向量维度,以隔离短语独有的特征。
  • 该方法聚焦于目标短语与其上下文之间激活向量维度的交集,以识别编码模糊意义的维度。
  • 该工具根据共享激活维度和最小额外激活,对相似短语进行排序,突出显示语义和句法上相关的模糊表达。

实验结果

研究问题

  • RQ1深度神经网络能否学习到编码隐私政策中模糊性语言特征的向量表示?
  • RQ2尽管表面形式各异,学习到的词向量是否能捕捉模糊术语之间的句法和语义关系?
  • RQ3向量表示的交互式可视化能否揭示隐私政策文本中语义相似的模糊表达聚类?
  • RQ4该模型在多大程度上能通过共享向量维度识别模糊术语的同义表达(例如 'as needed' 和 'as reasonably practicable')?
  • RQ5在无需大规模标注数据集的情况下,基于向量的可视化是否可行地支持隐私政策文本的知识发现?

主要发现

  • 可视化工具成功识别出与 'as needed' 语义和句法上相似的多个短语,包括 'as is appropriate to'、'as described below' 和 'as reasonably practicable'。
  • 该模型通过共享向量维度捕捉了表达相似含义的模糊表达变体,表明嵌入向量编码了细微的语义关系。
  • 目标短语与其上下文之间激活向量维度的交集有效隔离了短语独有的特征,支持对模糊术语的聚焦分析。
  • 该方法展示了对模糊术语同义表达进行分组的能力,表明向量表示编码了超越表面形式的概念相似性。
  • 该方法揭示了隐私政策使用大量词汇变体来表达同一模糊概念,使全面列出术语的任务更加复杂。
  • 结果表明,基于深度学习的向量表示可作为自动化检测和分析法律及隐私文本中模糊性的基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。