[论文解读] Learning Sentence Representation with Guidance of Human Attention
本文提出了两种新颖的注意力机制——ATT-SUR 和 ATT-POS/CCG——通过基于人类阅读时间的认知预测因子(如意外度、词性标签和CCG上位标签)对词向量进行加权,从而增强句子表征。这些模型在24个SemEval STS数据集上显著提升了性能,表明基于人类注意力的加权方式可提升语义表征效果,且无需额外监督。
Recently, much progress has been made in learning general-purpose sentence representations that can be used across domains. However, most of the existing models typically treat each word in a sentence equally. In contrast, extensive studies have proven that human read sentences efficiently by making a sequence of fixation and saccades. This motivates us to improve sentence representations by assigning different weights to the vectors of the component words, which can be treated as an attention mechanism on single sentences. To that end, we propose two novel attention models, in which the attention weights are derived using significant predictors of human reading time, i.e., Surprisal, POS tags and CCG supertags. The extensive experiments demonstrate that the proposed methods significantly improve upon the state-of-the-art sentence representation models.
研究动机与目标
- 通过整合阅读行为中观察到的人类注意力动态,改进句子表征模型。
- 解决现有模型对所有词一视同仁的局限性,该做法与人类选择性注意力的阅读模式相悖。
- 利用人类阅读时间的认知预测因子,开发一种与任务无关的句子级表征注意力机制。
- 评估意外度、词性标签和CCG上位标签等预测因子是否能有效引导可解释的注意力机制于句子嵌入中。
- 证明基于人类阅读行为引导的注意力可提升语义文本相似度任务的性能。
提出的方法
- ATT-SUR模型直接使用词的意外度值(衡量信息量)作为句子表征中词向量的注意力权重。
- ATT-POS 和 ATT-CCG 模型使用可学习的词性标签和CCG上位标签嵌入向量,通过学习的注意力机制计算注意力权重。
- 注意力加权的句子表征通过词嵌入的加权和计算得出,其中权重来源于认知预测因子,而非学习的注意力模块。
- 所提出的注意力模块被整合到Siamese CBOW(SCBOW)模型中,该模型是强大的无监督句子表征基线模型。
- 模型通过端到端方式训练,采用交叉熵损失函数预测语料中句子的相邻关系,以优化SCBOW目标。
- 该方法具有通用性,可应用于SCBOW基线以外的其他句子表征模型。
实验结果
研究问题
- RQ1能否利用人类阅读时间的认知预测因子(如意外度和词性标签)来引导句子表征模型中的注意力?
- RQ2将人类注意力动态整合是否能提升跨多样化领域句子嵌入的语义质量?
- RQ3基于认知因素的注意力权重与神经注意力机制的权重相比,在可解释性和性能方面有何差异?
- RQ4这些注意力模型在多大程度上能预测实际的人类阅读时间,从而验证其认知合理性?
- RQ5整合多种认知预测因子(如意外度+词性标签)是否能带来进一步的性能提升?
主要发现
- 所提出的ATT-SUR和ATT-POS/CCG模型在24个SemEval数据集中的23个上显著优于SCBOW基线模型,用于语义文本相似度任务。
- 实验表明,由意外度和词性标签等认知因素引导的注意力可生成更鲁棒、更具语义意义的句子表征。
- 定性分析证实,注意力权重集中于内容丰富的词(如名词和动词),与人类注视模式一致。
- 模型成功预测了人类阅读时间,眼动追踪数据中观察到预测注意力权重与实际注视持续时间之间存在显著相关性。
- 将SIF加权与所提出的注意力模型结合可进一步提升性能,表明二者捕获了互补的信息。
- 结果表明,人类阅读行为中的认知信号可作为有效且可扩展的归纳偏置,用于改进NLP模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。