[论文解读] TX-Ray: Quantifying and Explaining Model-Knowledge Transfer in (Un-)Supervised NLP
TX-Ray 提出了一种新颖的可解释性方法,通过分析预训练、零样本推理和微调阶段的神经元激活偏好,量化并可视化 NLP 模型中的知识迁移。该方法将激活最大化扩展至 NLP 领域,实现了对自监督模型如何构建语言抽象以及监督如何重塑神经元偏好的细粒度追踪,并通过剪枝实验验证了其识别与任务无关神经元并提升泛化能力的能力。
While state-of-the-art NLP explainability (XAI) methods focus on explaining per-sample decisions in supervised end or probing tasks, this is insufficient to explain and quantify model knowledge transfer during (un-)supervised training. Thus, for TX-Ray, we modify the established computer vision explainability principle of 'visualizing preferred inputs of neurons' to make it usable transfer analysis and NLP. This allows one to analyze, track and quantify how self- or supervised NLP models first build knowledge abstractions in pretraining (1), and then transfer these abstractions to a new domain (2), or adapt them during supervised fine-tuning (3). TX-Ray expresses neurons as feature preference distributions to quantify fine-grained knowledge transfer or adaptation and guide human analysis. We find that, similar to Lottery Ticket based pruning, TX-Ray based pruning can improve test set generalization and that it can reveal how early stages of self-supervision automatically learn linguistic abstractions like parts-of-speech.
研究动机与目标
- 解决当前缺乏能够解释并量化在无监督和有监督 NLP 训练过程中知识迁移的方法,超越对单样本决策的解释。
- 实现对自监督模型在预训练过程中如何构建诸如词性标注等语言抽象的分析。
- 在不重新训练的情况下,测量从预训练到新领域的零样本知识迁移。
- 研究在微调过程中监督如何重新配置神经元偏好,并将知识反向传递至模型内部抽象。
- 通过证明基于 TX-Ray 测量的剪枝能提升测试集泛化能力,验证该方法的忠实性。
提出的方法
- TX-Ray 将计算机视觉中的激活最大化方法适配至 NLP,通过将神经元建模为对离散输入(如标记或词性标签)的特征偏好分布。
- 计算并比较三个阶段的激活分布:在源语料上的预训练、在目标领域上的零样本推理,以及有监督的微调。
- 通过测量激活质量分布的偏移来量化神经元的知识迁移,其中稀疏化表示专业化,更广的分布表示泛化性。
- 利用这些分布指导神经元剪枝,移除对任务相关特征偏好较低的神经元可提升泛化能力。
- 通过在各阶段对排序后的激活质量进行可视化,该方法既支持详细的神经元级分析,也提供高层次的模型概览。
- 该方法应用于 BERT 风格编码器,并在 IMDB 和 WikiText-2 数据集上通过激活模式和剪枝结果进行了验证。
实验结果
研究问题
- RQ1我们如何解释并量化 NLP 模型在自监督预训练过程中的知识迁移?
- RQ2预训练模型在不重新训练的情况下,会将哪些知识子集应用于新领域,即在零样本设置下?
- RQ3知识迁移是否能‘反向’从监督标签进入预训练模型的内部抽象?
- RQ4基于 TX-Ray 的剪枝度量是否能识别出在移除后会提升或降低测试集泛化能力的神经元?
- RQ5模型在预训练的哪个阶段开始学习诸如词性标注等语言抽象?
主要发现
- TX-Ray 揭示了在预训练过程中,自监督机制会自动学习诸如词性标注等语言抽象,且神经元在训练早期即表现出对词性标签的强烈偏好。
- 在有监督数据上微调后,神经元激活分布显著变得更稀疏(例如,峰值激活质量增加),表明其已专业化于下游任务。
- 基于 TX-Ray 偏好分布的剪枝能提升测试集泛化能力,验证了该方法识别与任务无关神经元的能力。
- 监督不仅导致灾难性遗忘,还激活了此前未被充分利用的神经元,为原本不被偏好的特征注入了新知识。
- 该方法检测到预训练与零样本推理之间的领域不匹配,表现为在分布外数据上激活分布更广且更弱。
- TX-Ray 可视化显示,微调后的模型具有更高的峰值激活质量与更短的尾部,表明其抽象更集中且更具任务特异性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。