Skip to main content
QUICK REVIEW

[论文解读] Dial2Desc: End-to-end Dialogue Description Generation

Haojie Pan, Junpei Zhou|arXiv (Cornell University)|Nov 1, 2018
Topic Modeling参考文献 29被引用 15
一句话总结

本文提出Dial2Desc,一项新型端到端对话描述生成任务,可生成对对话中核心对象或动作的高抽象性摘要。该工作提出一种基于Transformer的模型,结合交叉注意机制与密集连接结构,以捕捉跨说话人交互,其在包含122,621对对话-描述的新数据集上达到最先进性能,相较于PGN和Onmt-transformer基线模型,CIDEr指标分别提升9.8%和10.8%。

ABSTRACT

We first propose a new task named Dialogue Description (Dial2Desc). Unlike other existing dialogue summarization tasks such as meeting summarization, we do not maintain the natural flow of a conversation but describe an object or an action of what people are talking about. The Dial2Desc system takes a dialogue text as input, then outputs a concise description of the object or the action involved in this conversation. After reading this short description, one can quickly extract the main topic of a conversation and build a clear picture in his mind, without reading or listening to the whole conversation. Based on the existing dialogue dataset, we build a new dataset, which has more than one hundred thousand dialogue-description pairs. As a step forward, we demonstrate that one can get more accurate and descriptive results using a new neural attentive model that exploits the interaction between utterances from different speakers, compared with other baselines.

研究动机与目标

  • 为解决缺乏高抽象性、聚焦于对象或动作的对话摘要问题,提出新任务Dial2Desc,旨在生成对话核心主题的简洁描述。
  • 通过整合VisualDialog与COCO数据集,构建大规模、高质量对齐的对话到描述数据集,支持对话描述生成的端到端训练。
  • 开发一种新型神经模型,通过共注意力与密集连接结构捕捉说话人之间的交互,提升摘要质量,超越标准序列到序列或Transformer基线模型。
  • 证明建模说话人交互动态可生成比将对话视为整体序列的方法更准确、更丰富的摘要。

提出的方法

  • 所提模型采用共注意力机制,显式建模不同说话人话语之间的交互,实现更丰富的跨轮次理解。
  • 在编码器中引入密集连接结构,增强对话轮次间特征传播与信息传递。
  • 编码器基于Transformer架构构建,以保持对话上下文中的长距离依赖与序列连贯性。
  • 解码器为基于Transformer的指针-生成网络,支持罕见词或OOV词的复制机制,提升事实一致性。
  • 模型在来自VisualDialog与COCO数据集的122,621对大规模对话-描述数据集上进行端到端训练。
  • 推理阶段采用不同束宽(beam size)的束搜索,覆盖机制虽被评估但发现会降低性能,故未纳入最终模型。

实验结果

研究问题

  • RQ1是否一种显式建模跨说话人交互的神经模型,能生成比标准序列到序列或Transformer基线更准确、更丰富的对话摘要?
  • RQ2在编码器中整合共注意力与密集连接结构,对高抽象级别对话描述质量有何影响?
  • RQ3所提模型在对话描述生成任务中,相较于现有抽象与抽取式摘要方法,优势程度如何?
  • RQ4使用大规模、开放词汇的对话到描述数据集,是否能提升对话描述任务的泛化能力与性能?

主要发现

  • 所提模型在所有ROUGE与CIDEr指标上均达到最优性能,相较于PGN基线模型CIDEr提升9.8%,相较于Onmt-transformer基线模型提升10.8%。
  • 模型需使用较大束宽(如K=10)才能达到最优性能,表明由于Transformer解码器的自回归生成机制,需探索更大的搜索空间。
  • 覆盖机制显著降低性能,因此被排除在最终模型之外,表明注意力解码已足够满足此任务需求。
  • 定性分析显示,模型生成的摘要更准确、更全面,能正确捕捉关键实体如“grapes”和“wine glasses”,而其他模型常遗漏或错误表示。
  • 共注意力机制成功实现跨说话人关键词对齐——例如,一个话语中的“many”会关注另一话语中的“10”,证明了有效的说话人间对齐。
  • 即使使用相似组件,该模型仍优于RNN与Transformer基线模型,证明增强的交互编码器具有显著有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。