Skip to main content
QUICK REVIEW

[论文解读] Robust Dialogue Utterance Rewriting as Sequence Tagging

Jie Hao, Linfeng Song|arXiv (Cornell University)|Dec 29, 2020
Topic Modeling参考文献 25被引用 5
一句话总结

该论文提出了一种用于鲁棒对话话语重写的任务序列标注方法,通过将重写建模为词级删除和上下文片段插入来缩小搜索空间。通过使用BLEU和GPT-2困惑度的REINFORCE方法注入流畅性信号,该模型实现了最先进性能,在跨域评估中BLEU4提升14.6分,精确匹配提升18.9%,同时比生成式模型更好地保持了语义内容。

ABSTRACT

The task of dialogue rewriting aims to reconstruct the latest dialogue utterance by copying the missing content from the dialogue context. Until now, the existing models for this task suffer from the robustness issue, i.e., performances drop dramatically when testing on a different domain. We address this robustness issue by proposing a novel sequence-tagging-based model so that the search space is significantly reduced, yet the core of this task is still well covered. As a common issue of most tagging models for text generation, the model's outputs may lack fluency. To alleviate this issue, we inject the loss signal from BLEU or GPT-2 under a REINFORCE framework. Experiments show huge improvements of our model over the current state-of-the-art systems on domain transfer.

研究动机与目标

  • 解决对话话语重写中的鲁棒性问题,因为现有模型在域外测试集上性能显著下降。
  • 通过将重写任务建模为序列标注而非序列生成,来缩小重写任务的搜索空间。
  • 通过注入来自BLEU和GPT-2困惑度的外部监督,提升基于标注模型的输出流畅性。
  • 在重写过程中保持语义保真度,同时实现跨域更好的泛化能力。

提出的方法

  • 将对话话语重写建模为多任务序列标注问题,其中每个输入词被标注为删除或保留,同时预测插入的上下文片段。
  • 通过从对话上下文预测插入位置的片段边界来定义受限的搜索空间。
  • 采用基于REINFORCE的框架并引入基线,通过句子级BLEU和GPT-2困惑度的奖励信号优化流畅性。
  • 利用预训练的GPT-2提供无需参考文本的流畅性信号,从而在开放域设置中提升性能。
  • 在强化学习目标中整合多种监督信号——BLEU用于基于参考的对齐,GPT-2困惑度用于流畅性。
  • 采用联合标注头同时预测删除和插入决策,实现端到端训练。

实验结果

研究问题

  • RQ1与序列生成方法相比,序列标注建模是否能提升对话话语重写模型在域外测试集上的鲁棒性?
  • RQ2在输出中缺乏词与词之间直接交互的序列标注模型中,如何有效提升流畅性?
  • RQ3在无需参考摘要的情况下,将GPT-2困惑度作为奖励信号在多大程度上能提升生成质量?
  • RQ4与基于生成的基线相比,所提方法是否能更好地保留输入话语的语义内容?
  • RQ5对于其标注逻辑未覆盖的挑战性、未见样本,该模型表现如何?

主要发现

  • 所提出的RaST+RL-GPT2模型在跨域评估中,相比之前最先进方法,BLEU4提升14.6分,精确匹配提升18.9个百分点。
  • 在人工评估中,该模型优于所有基线,且在成对比较中赢得案例数最多。
  • 语义角色标注(SRL)分析表明,该模型比基线更好地保留了核心语义含义,在域内和域外设置下的F1分数均最高。
  • 由于其受限的搜索空间,案例研究显示该模型生成的流畅性错误(如重复用词或不当插入)更少。
  • 在未见样本上,该模型保持了较高的BLEU4(56.4)和显著更高的内容召回率(R-L: 70.7),表明其具备更强鲁棒性。
  • 该模型在未见样本上的精确匹配接近零,但这是由其基于标注的设计所预期的,且与基线的性能差距极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。