Skip to main content
QUICK REVIEW

[论文解读] Semantic-based Pre-training for Dialogue Understanding

Xuefeng Bai, Linfeng Song|arXiv (Cornell University)|Sep 19, 2022
Topic Modeling被引用 4
一句话总结

本文提出SARA,一种基于语义的预训练框架,通过在预训练中整合抽象意义表示(AMR)图来增强对话理解。通过引入三项AMR引导的任务——语义掩码语言建模、语义关系预测和语义一致性——SARA在开放域对话和任务导向型对话基准上均提升了模型性能,实现了SOTA结果,且在推理阶段无需外部解析器。

ABSTRACT

Pre-trained language models have made great progress on dialogue tasks. However, these models are typically trained on surface dialogue text, thus are proven to be weak in understanding the main semantic meaning of a dialogue context. We investigate Abstract Meaning Representation (AMR) as explicit semantic knowledge for pre-training models to capture the core semantic information in dialogues during pre-training. In particular, we propose a semantic-based pre-training framework that extends the standard pre-training framework (Devlin et al., 2019) by three tasks for learning 1) core semantic units, 2) semantic relations and 3) the overall semantic representation according to AMR graphs. Experiments on the understanding of both chit-chats and task-oriented dialogues show the superiority of our model. To our knowledge, we are the first to leverage a deep semantic representation for dialogue pre-training.

研究动机与目标

  • 为解决当前预训练对话模型在捕捉表面文本之外深层语义意义方面的局限性。
  • 探究显式语义结构(如AMR)是否能在预训练过程中提升对话表征学习。
  • 通过在预训练中直接整合语义知识,减少下游应用对外部解析器的依赖。
  • 通过更丰富的语义监督,提升在任务导向型和开放域对话理解任务上的性能。
  • 证明AMR中的细粒度语义关系对模型泛化能力和鲁棒性的实质性贡献。

提出的方法

  • 在标准预训练基础上扩展三项基于AMR的任务:(1) 聚焦核心语义单元的语义掩码语言建模,(2) 词语之间的语义关系预测,(3) 对话文本与其AMR图之间的语义一致性。
  • 使用AMR图作为显式监督信号,引导模型在预训练过程中学习核心语义单元及其关系。
  • 采用BERT和RoBERTa作为主干模型,在大规模对话数据上通过SARA框架进行微调。
  • 通过掩码细粒度关系构建简化版AMR变体,以消融分析详细语义结构的贡献。
  • 设计联合预训练目标,对齐对话文本的上下文表征与其对应的AMR图。
  • 通过在预训练阶段端到端学习语义结构,消除推理阶段对外部语义解析器的需求。

实验结果

研究问题

  • RQ1来自AMR图的显式语义知识是否能提升预训练对话模型在理解任务上的性能?
  • RQ2与简化版或框架式关系相比,AMR中的细粒度语义关系在模型泛化中起到何种作用?
  • RQ3在预训练中整合AMR是否能提升模型对虚假特征和对抗性样本的鲁棒性?
  • RQ4即使训练数据较少,语义感知的预训练框架是否仍能优于标准预训练?
  • RQ5与仅在推理阶段使用AMR的系统相比,所提方法在效率和准确率上表现如何?

主要发现

  • SARA-RoBERTa在DialogRE上达到67.8 F1,在DSTC8上达到92.02 F1,优于RoBERTa(65.8和90.78)及先前基于语义的模型。
  • 包含细粒度关系的完整AMR图比简化版AMR图表现更优,表明详细语义关系有助于提升学习效果。
  • 与Bai et al. (2021)的方法相比,SARA在推理速度上实现约45倍加速,尤其在长对话中优势显著。
  • 模型在复杂对话中表现出更强鲁棒性,即使表面文本包含误导性线索,也能正确识别关系和意图。
  • 随着预训练数据量增加,性能持续提升,在DialogRE上数据扩展带来约2.0 F1的增益,表明具有强大的数据效率。
  • 案例研究证实,SARA能更好地捕捉核心语义单元,并避免对情感强烈但语义无关的词语产生错误关注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。