[论文解读] Automatic Prediction of Discourse Connectives
本文提出一种神经方法,利用分解注意力(DA)模型自动预测句子对之间的语篇连接词(例如,然而、此外等)。该模型在包含290万个维基百科句子对的大规模数据集上进行训练,F1得分为32,优于人类标注者(F1为30),同时通过注意力机制展现出类人的错误模式和可解释性。
Accurate prediction of suitable discourse connectives (however, furthermore, etc.) is a key component of any system aimed at building coherent and fluent discourses from shorter sentences and passages. As an example, a dialog system might assemble a long and informative answer by sampling passages extracted from different documents retrieved from the Web. We formulate the task of discourse connective prediction and release a dataset of 2.9M sentence pairs separated by discourse connectives for this task. Then, we evaluate the hardness of the task for human raters, apply a recently proposed decomposable attention (DA) model to this task and observe that the automatic predictor has a higher F1 than human raters (32 vs. 30). Nevertheless, under specific conditions the raters still outperform the DA model, suggesting that there is headroom for future improvements.
研究动机与目标
- 为解决在摘要和对话系统中自动预测合适语篇连接词以提升文本连贯性的挑战。
- 收集并发布一个大规模的290万个句子对数据集,其中包含语篇连接词,用于语篇连接词预测任务。
- 评估神经模型(特别是分解注意力模型)在此任务上的性能,并与人类标注者进行比较。
- 探究神经模型是否能够学习到用于连接词选择的有意义的语言和语义线索。
- 通过注意力对齐矩阵分析模型的可解释性,并将错误模式与人类标注者进行比较。
提出的方法
- 作者从英文维基百科中收集了290万个连续的句子对,涵盖包含连接词和不包含连接词的情况。
- 他们包含10,000个人工标注样本用于评估,标注者需从79种语篇连接词中选择最合适的连接词。
- 应用分解注意力(DA)模型来预测两个句子之间的语篇连接词,将其视为双句子分类任务。
- DA模型在两个句子的词元之间计算软注意力,从而实现对哪些词影响预测结果的解释。
- 模型通过交叉熵损失和Softmax分类,预测79种语篇连接词中的一种或[无连接词]。
- 通过注意力热力图分析模型的可解释性,显示第一句话中的哪些词与第二句话中的词对齐,以支持连接词选择。
实验结果
研究问题
- RQ1神经模型能否在句子对之间的语篇连接词预测任务中超越人类标注者?
- RQ2DA模型的错误模式与人类标注者的错误模式在语篇连接词预测中如何比较?
- RQ3当选择语篇连接词时,神经模型学习到了哪些语言和语义线索?
- RQ4模型的注意力机制是否提供了句子对之间可解释且有意义的对齐?
- RQ5在何种条件下,人类标注者仍优于神经模型?
主要发现
- 分解注意力模型在测试集上取得32的F1得分,超过人类标注者(F1为30)。
- 模型的混淆矩阵与人类错误模式高度相似,表明其推理和决策倾向与人类相近。
- 当限制在多数标注者一致选择显式连接词的案例时,人类标注者优于模型,表明人类更偏好隐含或高频连接词。
- 模型学会关注语义和句法上相关的词对,例如对比性词语(如“attempt”和“refuse”)或时态标记(如“was disqualified”和“had gone”),这些均支持连接词预测。
- 注意力热力图显示,模型能对齐相关的词汇和语法线索,如过去时和完成体,以预测“by then”等连接词。
- 模型在语义相近的连接词之间频繁出错,如“however”与“nevertheless”,以及“instead”与“rather”,这些错误也反映了人类标注者的行为特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。