Skip to main content
QUICK REVIEW

[论文解读] Conversational Question Reformulation via Sequence-to-Sequence Architectures and Pretrained Language Models

Sheng-Chieh Lin, Jheng-Hong Yang|arXiv (Cornell University)|Apr 4, 2020
Topic Modeling参考文献 22被引用 36
一句话总结

本论文通过序列到序列模型和预训练语言模型对会话式问题改写(CQR)进行实证研究,结果显示 T5 在 CANARD 和 CAsT 上达到最新 BLEU,接近人类在 CANARD 上的表现。

ABSTRACT

This paper presents an empirical study of conversational question reformulation (CQR) with sequence-to-sequence architectures and pretrained language models (PLMs). We leverage PLMs to address the strong token-to-token independence assumption made in the common objective, maximum likelihood estimation, for the CQR task. In CQR benchmarks of task-oriented dialogue systems, we evaluate fine-tuned PLMs on the recently-introduced CANARD dataset as an in-domain task and validate the models using data from the TREC 2019 CAsT Track as an out-domain task. Examining a variety of architectures with different numbers of parameters, we demonstrate that the recent text-to-text transfer transformer (T5) achieves the best results both on CANARD and CAsT with fewer parameters, compared to similar transformer architectures.

研究动机与目标

  • 在对话式问答和任务导向对话中,说明在上下文中改写问题以解决共指与省略的必要性。
  • 研究预训练语言模型是否能够放宽 CQR 中 MLE 的逐字独立性假设。
  • 在 CANARD(领域内)和 CAsT(领域外)上评估不同的 PLMs 与 S2S 架构,以发现表现出色的模型。

提出的方法

  • 将 CQR 形式化为一个序列到序列任务,其输入为当前问题与对话历史,输出为改写后的问题。
  • 在 CANARD 上对一系列模型进行微调(基于 LSTM 的 S2S、GPT-2、BERT、UniLM 和 T5),以历史与当前查询拼接作为上下文。
  • 使用 BLEU 作为评估指标,将输出与 CANARD 和 CAsT 上的人类改写参考进行比较。
  • 探索解码策略,包括贪婪搜索、束搜索(宽度最多为 10)和 top-k 采样,以评估解码对结果的敏感性。
  • 公布模型参数数量和训练设置以便复现。

实验结果

研究问题

  • RQ1预训练语言模型是否能够在 CQR 中超越纯 MLE 基线来改善会话式问题改写?
  • RQ2哪些模型架构(及其参数规模)在 CANARD 和 CAsT 中最能利用上下文/历史来改写问题?
  • RQ3解码策略如何影响以 BLEU 衡量的 CANARD 和 CAsT 上的 CQR 质量?

主要发现

  • T5-base 在 Greedy 解码下,在 CANARD (59.13) 和 CAsT (58.08) 的 BLEU 中达到测试模型中的最佳值。
  • T5-base 配合束搜索(宽度 = 10)在 CAsT 上达到 BLEU 76.22,在 CANARD 上接近人类表现(人类 BLEU 约 59.92,模型在 58–60 区间)。
  • 在 CANARD 上,人类表现优于模型,Human 59.92 BLEU,Raw 33.84;多种 PLM 相对于 Raw 有所提升,例如 UniLM-large 在 CANARD Dev 为 57.39、CAsT Dev 为 55.92。
  • GPT-2-medium 和 BERT-large 也优于 LSTM,GPT-2-medium 在 CANARD Dev 为 52.63、CANARD Test 为 50.07;BERT-large 在 CANARD Dev 为 55.34、CANARD Test 为 54.34。
  • UniLM-large 与 T5-base 在各数据集上均显著优于其他架构,体现了文本到文本传递模型在 CQR 中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。