[论文解读] Transformers to Learn Hierarchical Contexts in Multiparty Dialogue for Span-based Question Answering
本论文提出了一种基于层次化Transformer表示的多任务微调方法,用于多角色对话中的跨度抽取型问答任务,引入了话语级掩码语言建模和话语顺序预测,以提升对话上下文的理解能力。该方法在FriendsQA数据集上取得了当前最优的结果,精确匹配(EM)指标分别优于BERT和RoBERTa 3.8%和1.4%。
We introduce a novel approach to transformers that learns hierarchical representations in multiparty dialogue. First, three language modeling tasks are used to pre-train the transformers, token- and utterance-level language modeling and utterance order prediction, that learn both token and utterance embeddings for better understanding in dialogue contexts. Then, multi-task learning between the utterance prediction and the token span prediction is applied to fine-tune for span-based question answering (QA). Our approach is evaluated on the FriendsQA dataset and shows improvements of 3.8% and 1.4% over the two state-of-the-art transformer models, BERT and RoBERTa, respectively.
研究动机与目标
- 为解决现有Transformer模型在多角色对话中进行跨度抽取型问答时表现不佳的问题,该问题源于对异构、多说话人话语的建模挑战。
- 通过在词元和话语层级上学习层次化表示,利用专门设计的预训练任务来提升对话理解能力。
- 通过在词元跨度预测和话语身份预测上联合微调,提升模型在对话上下文中的泛化能力和推理能力。
- 评估对话特定的预训练目标——话语级掩码语言建模和话语顺序预测——在基于跨度的问答基准上的有效性。
- 分析对话问答中的失败模式和错误类型,特别是涉及实体消解和跨话语推理的复杂问题。
提出的方法
- 使用三项任务对Transformer模型进行预训练:词元级掩码语言建模(t-MLM)、话语级掩码语言建模(u-MLM)和话语顺序预测(UOP)。
- 使用t-MLM在完整对话序列中学习上下文相关的词元表示,同时保留说话人和话语的边界信息。
- 应用u-MLM通过掩码整个话语并从上下文中预测其内容,来学习话语级表示,从而提升话语级语义理解能力。
- 通过预测打乱后话语的正确顺序来实现UOP,以学习对话的序列结构,增强对时间顺序和语篇连贯性的建模。
- 通过多任务学习进行模型微调,联合优化词元跨度预测(用于答案抽取)和话语身份预测(用于对话结构感知)。
- 在推理过程中,对词元和话语嵌入分别使用独立的多头注意力机制,以支持层次化推理。
实验结果
研究问题
- RQ1话语级掩码语言建模和话语顺序预测是否能提升对话上下文中的话语级表示质量?
- RQ2在跨度预测和话语身份预测上进行联合多任务微调,是否能提升多角色对话中跨度抽取型问答的性能?
- RQ3与标准预训练相比,对话特定的预训练目标在FriendsQA数据集上的下游问答性能表现如何?
- RQ4基于跨度的对话问答中的主要错误类型是什么?它们与'谁'、'如何'和'为什么'等问题类型有何关联?
- RQ5层次化表示在多大程度上能减少实体消解和跨话语推理任务中的错误?
主要发现
- 所提方法在FriendsQA数据集上实现了53.5%的精确匹配(EM)指标,相较于BERT绝对提升3.8%,相较于RoBERTa提升1.4%。
- 话语级掩码语言建模与话语顺序预测相结合,并联合微调跨度预测和话语身份预测任务,取得了最佳性能,相较于BERT提升3.8%,相较于RoBERTa提升1.4%。
- 消融实验表明,尽管u-MLM和UOP单独使用仅带来微小增益,但与话语身份预测联合使用时性能显著提升,表明预训练与微调之间存在显著协同效应。
- 错误分析显示,实体消解和跨话语推理是两类最常见的错误类型,分别占'who'和'how'类问题错误的34%和25%。
- 对于涉及跨话语推理的复杂问题,该模型在完整预训练和多任务微调设置下,相较于BERT和RoBERTa,EM指标分别提升了2%和1%。
- 结果表明,对话特定的预训练目标对于提升对话问答性能至关重要,尤其在与结构化多任务微调结合时效果更显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。