[论文解读] Whatcha lookin' at? DeepLIFTing BERT's Attention in Question Answering
该论文使用DeepLIFT解释BERT在阅读理解任务中多头注意力机制的运作,揭示了注意力从早期层的句法结构逐渐转向深层中与答案相关token的机制。结果表明,BERT通过逐层注意力聚类与归因分析,逐步将关注焦点从一般输入特征缩小至精确的答案片段,其过程类似于人类的推理模式。
There has been great success recently in tackling challenging NLP tasks by neural networks which have been pre-trained and fine-tuned on large amounts of task data. In this paper, we investigate one such model, BERT for question-answering, with the aim to analyze why it is able to achieve significantly better results than other models. We run DeepLIFT on the model predictions and test the outcomes to monitor shift in the attention values for input. We also cluster the results to analyze any possible patterns similar to human reasoning depending on the kind of input paragraph and question the model is trying to answer.
研究动机与目标
- 探究BERT的多头注意力机制如何促进其在阅读理解任务中的高性能表现。
- 利用DeepLIFT分析注意力值在BERT各层之间的演变,以提升模型可解释性。
- 通过聚类注意力表征,检测其行为模式是否与人类推理相似。
- 理解BERT如何在上下文中定位相关信息以实现答案预测。
- 揭示预训练Transformer模型(如BERT)为何在NLP基准测试中优于以往模型。
提出的方法
- 在SQuaD 2.0数据集上对BERT-base进行微调,采用[CLS]question[SEP]paragraph[SEP]的tokenization方式处理阅读理解任务。
- 应用DeepLIFT将最终预测层的归因分数反向传播至输入token,分配正向或负向贡献值。
- 由于PyTorch的限制,对DeepLIFT的反向传播过程进行修改,以适配BERT复杂的多头、多层注意力模块。
- 提取各层的注意力分数,并通过聚类方法对不同输入类型的注意力模式进行分组。
- 使用颜色编码的token可视化注意力转移过程,其中红色表示高注意力,蓝色表示低注意力。
- 以start和end token的预测作为归因目标神经元,采用最高概率的答案片段作为参考。
实验结果
研究问题
- RQ1在阅读理解推理过程中,BERT的注意力如何随各层演变?
- RQ2在早期与后期层中,哪些输入token获得最高注意力,这种分布与答案预测有何关联?
- RQ3不同输入类型的注意力模式是否聚类为具有独立特征的组,反映出类似推理的行为?
- RQ4BERT中的注意力头在多大程度上关注句法、语义或结构线索(如标点符号和分隔符)?
- RQ5注意力的演变与阅读理解任务中的人类推理模式在多大程度上相关?
主要发现
- 在早期层中,BERT主要关注[CLS]、[SEP]分隔符和标点符号,表明其早期进行句法处理。
- 至第4层时,注意力转向问题中的关键词(如'beyonce'),从第5层起完全忽略这些词,表明注意力具有动态聚焦特性。
- 在深层中,注意力重新聚焦于问题关键词(如'beyonce'),以语义方式验证答案上下文,表明存在两阶段推理过程。
- 在最终层,注意力完全集中于答案片段'late 1990s',表明其关注焦点已精准收敛至正确答案。
- 注意力模式根据问题类型聚类为不同组别,且在不同输入类型中均表现出从句法关注向语义关注的稳定转变。
- 模型的注意力行为揭示了一个从句法结构感知到语义验证的渐进过程,与人类在阅读理解中的推理方式高度相似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。