Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Generative Conversational Query Rewriting

Yu Shi, Jiahua Liu|arXiv (Cornell University)|Jun 9, 2020
Topic Modeling参考文献 2被引用 7
一句话总结

本文提出了一种基于弱监督的 few-shot 生成式对话查询重写方法,利用临时搜索会话中的规则方法和自监督学习进行弱监督。仅用 50 个手动重写样本微调 GPT-2,即可在 NDCG@3 上相比最先进系统提升 12%,展示了强大的 few-shot 泛化能力,并有效捕捉了上下文依赖关系,包括长轮次共指现象。

ABSTRACT

Conversational query rewriting aims to reformulate a concise conversational query to a fully specified, context-independent query that can be effectively handled by existing information retrieval systems. This paper presents a few-shot generative approach to conversational query rewriting. We develop two methods, based on rules and self-supervised learning, to generate weak supervision data using large amounts of ad hoc search sessions, and to fine-tune GPT-2 to rewrite conversational queries. On the TREC Conversational Assistance Track, our weakly supervised GPT-2 rewriter improves the state-of-the-art ranking accuracy by 12%, only using very limited amounts of manual query rewrites. In the zero-shot learning setting, the rewriter still gives a comparable result to previous state-of-the-art systems. Our analyses reveal that GPT-2 effectively picks up the task syntax and learns to capture context dependencies, even for hard cases that involve group references and long-turn dependencies.

研究动机与目标

  • 为解决低资源对话查询重写问题,即人工重写成本高且稀缺。
  • 探究预训练语言模型(如 GPT-2)是否能仅通过少量人工重写样本实现有效泛化。
  • 利用大量临时搜索会话开发弱监督技术,训练有效的查询重写模型,而无需依赖大规模人工标注。
  • 通过生成去上下文化、与上下文无关的查询,提升对话信息检索系统的性能,使其更兼容现有检索模型。

提出的方法

  • 使用基于规则的方法生成弱监督数据,通过省略或共指重复名词短语的方式处理临时搜索会话中的查询。
  • 利用少量人工重写样本,微调自监督的 GPT-2 模型,将临时查询简化为更具对话性、依赖上下文的形式。
  • 在弱监督数据上微调 GPT-2,以生成适用于对话搜索会话的上下文感知查询重写结果。
  • 通过交叉验证和仅在 TREC CAsT 的 50 个对话会话上进行 few-shot 微调,评估模型的泛化能力。
  • 使用 NDCG@3 和 BLEU 分数评估模型性能,与基线系统及人工最优重写结果进行比较。
  • 通过案例研究分析模型行为,重点关注共指消解和上下文依赖处理能力。

实验结果

研究问题

  • RQ1GPT-2 是否能在仅使用少量人工标注重写样本的情况下,实现强大的对话查询重写性能?
  • RQ2基于规则和自监督的方法在从临时搜索会话中生成弱监督数据方面有多有效?
  • RQ3预训练语言模型(如 GPT-2)在无需大量微调的情况下,能在多大程度上学习到查询重写的句法与语义?
  • RQ4该模型在处理涉及长轮次依赖关系和群体引用的复杂情况时,泛化能力如何?
  • RQ5与现有最先进系统相比,模型在 few-shot 和 zero-shot 设置下的性能表现有何差异?

主要发现

  • 仅用 50 个手动重写的对话会话对 GPT-2 进行微调,可在 TREC CAsT 2019 的最佳自动运行结果基础上,将 NDCG@3 提升 12%。
  • 在 zero-shot 设置下,弱监督的 GPT-2 模型性能与之前最先进自动系统相当。
  • GPT-2 仅需三组对话会话即可学会生成类似问题的重写结果,并正确解析代词和共指现象。
  • 模型在多轮对话中保持稳定性能,表明其有效捕捉了多轮上下文信息。
  • BLEU 分数与 NDCG 呈强相关性,证实更优的查询重写可提升检索准确性。
  • 案例研究显示,GPT-2 能准确处理复杂的共指现象,如跨越三轮对话的群体引用,但偶尔会因指代模糊而遗漏上下文。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。