[论文解读] Language Model as an Annotator: Exploring DialoGPT for Dialogue Summarization
本文提出使用DialoGPT作为无监督标注器,自动提取关键词、检测冗余话语并进行对话主题分割,以提升对话摘要质量。通过将这些标注注入预训练(BART)和非预训练(PGN)摘要模型,该方法在SAMSum数据集上实现了最先进性能,相较于强基线模型在ROUGE分数上取得显著提升。
Current dialogue summarization systems usually encode the text with a number of general semantic features (e.g., keywords and topics) to gain more powerful dialogue modeling capabilities. However, these features are obtained via open-domain toolkits that are dialog-agnostic or heavily relied on human annotations. In this paper, we show how DialoGPT, a pre-trained model for conversational response generation, can be developed as an unsupervised dialogue annotator, which takes advantage of dialogue background knowledge encoded in DialoGPT. We apply DialoGPT to label three types of features on two dialogue summarization datasets, SAMSum and AMI, and employ pre-trained and non pre-trained models as our summarizes. Experimental results show that our proposed method can obtain remarkable improvements on both datasets and achieves new state-of-the-art performance on the SAMSum dataset.
研究动机与目标
- 为解决对话摘要中人工标注或基于开放域工具的标注方式存在的局限性,这些方式通常耗时费力或缺乏对话相关性。
- 利用DialoGPT中预训练的对话特定知识,自动生成三类辅助标注:关键词、冗余性指示符和主题片段。
- 通过将这些无监督标注集成到预训练和非预训练摘要模型中,提升对话摘要性能。
- 仅使用从DialoGPT衍生的无监督标注,在SAMSum数据集上实现最先进性能。
提出的方法
- DialoGPT标注器通过计算模型自回归生成过程中的词级和话语级预测损失,将这些损失用作标注信号。
- 关键词被提取为在上下文中预测不确定性高(可预测性低)的词语,表明其信息量高。
- 冗余性检测通过识别插入后对话上下文表征变化极小的话语来实现,表明其内容对上下文影响有限。
- 主题分割通过在难以预测的话语前插入主题边界标记符来实现,指示话语主题的转移。
- 将标注结果——关键词、冗余标记和主题片段——以特殊标记(#KEY#、[RD]、[TS])形式注入对话输入摘要模型。
- 该方法在SAMSum和AMI数据集上进行评估,采用BART(预训练)和PGN(非预训练)作为摘要模型,以ROUGE分数为主要指标。
实验结果
研究问题
- RQ1预训练对话模型如DialoGPT能否被有效重用于无监督对话摘要标注?
- RQ2在不同摘要模型架构中,注入自动生成的标注(关键词、冗余性、主题)是否能提升摘要性能?
- RQ3所提方法在标准对话摘要基准上的性能与强基线及人工标注特征相比如何?
- RQ4三类标注(关键词、冗余性、主题)在单独和联合使用时,对摘要质量的贡献程度如何?
主要发现
- 所提方法在SAMSum数据集上实现了新的最先进性能,当使用全部三类标注时,ROUGE-L得分为49.64。
- 在SAMSum数据集上,该方法相比最佳基线(C99 + DialoGPT嵌入)的ROUGE-L提升0.14分,各项指标均表现出一致提升。
- 在AMI数据集上,该方法也取得了具有竞争力的结果,使用全部标注时ROUGE-L得分为24.05,优于基线C99 + DialoGPT嵌入。
- 三类标注(关键词、冗余性、主题)的联合集成带来最高性能,表明其具有互补优势。
- 即使在非预训练模型(PGN)上,该方法仍取得显著改进,表明标注质量在不同摘要模型类型间具有鲁棒性。
- 案例研究显示,与BART和MV-BART相比,该模型生成的摘要更简洁且主题一致性更高,但仍有部分冗余存在,可能源于训练数据有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。