Skip to main content
QUICK REVIEW

[论文解读] Perturbed Masking: Parameter-free Probing for Analyzing and Interpreting BERT

Zhiyong Wu, Yun Chen|arXiv (Cornell University)|Apr 30, 2020
Topic Modeling参考文献 48被引用 7
一句话总结

本文提出了一种无参数的探针方法——扰动掩码(Perturbed Masking),通过测量词元扰动对掩码标记预测的影响,分析 BERT 的语言表示。通过两阶段掩码和距离度量计算词元间的影响力,该方法恢复出的句法依存树优于基线模型,甚至超越人工设计的结构,在下游情感分类任务中表现更优,揭示了 BERT 内在的句法知识,且无需引入额外参数。

ABSTRACT

By introducing a small set of additional parameters, a probe learns to solve specific linguistic tasks (e.g., dependency parsing) in a supervised manner using feature representations (e.g., contextualized embeddings). The effectiveness of such probing tasks is taken as evidence that the pre-trained model encodes linguistic knowledge. However, this approach of evaluating a language model is undermined by the uncertainty of the amount of knowledge that is learned by the probe itself. Complementary to those works, we propose a parameter-free probing technique for analyzing pre-trained language models (e.g., BERT). Our method does not require direct supervision from the probing tasks, nor do we introduce additional parameters to the probing process. Our experiments on BERT show that syntactic trees recovered from BERT using our method are significantly better than linguistically-uninformed baselines. We further feed the empirically induced dependency structures into a downstream sentiment classification task and find its improvement compatible with or even superior to a human-designed dependency schema.

研究动机与目标

  • 为解决依赖额外模型参数的探针方法中存在的模糊性问题,这些参数可能捕捉的是特定任务的知识而非预训练模型的表示。
  • 开发一种无参数方法,直接探查 BERT 的内部表示,而无需引入新参数或监督标签。
  • 仅利用模型的掩码语言建模行为,从 BERT 中提取全局语言结构,特别是依存树。
  • 评估所诱导的句法结构是否能在下游 NLP 任务中提升性能,与基线模型和人工设计的结构进行比较。
  • 为依赖监督分类器和附加参数的先前探针研究提供一种互补的、无监督的验证方法。

提出的方法

  • 该方法执行两阶段掩码:首先将目标词元 $x_i$ 掩码为 [MASK],然后在同一序列中掩码一个上下文词元 $x_j$,以观察 $x_i$ 表示的变化。
  • 通过距离函数 $f(x_i, x_j) = d(H_{\theta}(\mathbf{x}\setminus\{x_i\})_i, H_{\theta}(\mathbf{x}\setminus\{x_i,x_j\})_i)$ 量化 $x_j$ 对 $x_i$ 的影响,其中 $d$ 为欧氏距离或标记预测概率的差异。
  • 评估两种距离度量:Dist(隐藏表示之间的欧氏距离)和 Prob($x_i$ 预测概率的差异)。
  • 利用得到的影响矩阵,通过贪心算法推断依存树,选择最强的影响力关系。
  • 该方法应用于句法分析和话语依存分析,结果与语言无关的基线模型及人工设计的结构进行比较。
  • 所诱导的依存结构在下游情感分类任务中进一步评估,以衡量其实际效用。

实验结果

研究问题

  • RQ1无参数探针方法是否能在不引入额外模型参数或监督标签的前提下,从 BERT 中提取有意义的句法结构?
  • RQ2与简单基线相比,扰动掩码诱导出的依存树与语言学家定义的句法结构在多大程度上一致?
  • RQ3通过扰动掩码学习到的句法结构是否在下游 NLP 任务中优于人工设计的依存结构?
  • RQ4从掩码语言建模中推导出的影响矩阵在多大程度上反映了 BERT 中编码的真实句法依赖关系?
  • RQ5该方法是否能揭示全局语言特性(如话语结构),表明 BERT 具备建模长距离依赖的能力?

主要发现

  • 使用扰动掩码恢复的句法树在依存分析任务中显著优于语言无关的基线模型(如右向分支和左向分支结构)。
  • 所诱导的依存结构在下游情感分类任务中的表现与人工设计的依存结构相当,甚至更优。
  • 该方法表明 BERT 以无监督、无参数的方式编码了丰富的句法知识,为其实体句法能力提供了下界估计。
  • 从两阶段掩码中推导出的影响矩阵有效捕捉了词元间的相关性,其效果类似于注意力机制,但源于模型输出而非中间表示。
  • 该方法表明,BERT 的自监督预训练过程产生了内在的句法结构,即使未显式监督语法,其在实践中也具有实用性。
  • 该方法成功推广至话语级依存分析,表明 BERT 具备建模句子级别以上长距离依赖的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。