[论文解读] What should I Ask: A Knowledge-driven Approach for Follow-up Questions Generation in Conversational Surveys
本文提出了一种基于知识的两阶段框架,通过利用对话历史和外部知识,实现生成信息丰富且连贯的对话式调查后续问题。该研究引入了一个新的由人工标注的知识数据集,并提出了无需参考的格里森式评估指标,实验证明其在生成上下文相关、清晰且信息丰富的问题方面优于基于GPT的基线模型。
Generating follow-up questions on the fly could significantly improve conversational survey quality and user experiences by enabling a more dynamic and personalized survey structure. In this paper, we proposed a novel task for knowledge-driven follow-up question generation in conversational surveys. We constructed a new human-annotated dataset of human-written follow-up questions with dialogue history and labeled knowledge in the context of conversational surveys. Along with the dataset, we designed and validated a set of reference-free Gricean-inspired evaluation metrics to systematically evaluate the quality of generated follow-up questions. We then propose a two-staged knowledge-driven model for the task, which generates informative and coherent follow-up questions by using knowledge to steer the generation process. The experiments demonstrate that compared to GPT-based baseline models, our two-staged model generates more informative, coherent, and clear follow-up questions.
研究动机与目标
- 解决开放域对话式调查中后续问题生成缺乏数据集和评估基准的问题。
- 通过整合对话历史之外的外部知识,提升后续问题的质量与多样性。
- 克服基于规则和模板的方法在动态、个性化调查交互中的局限性。
- 开发可扩展的、无需参考的评估指标,使其与人类对问题质量的判断保持一致。
- 通过上下文感知、知识增强的问题生成,实现更有效的对话式调查信息收集。
提出的方法
- 两阶段模型:首先,知识选择器基于对话历史从知识库中识别出关键的实体-关系对,作为问题的主题和关注点。
- 其次,基于GPT的生成模型在对话历史和所选知识的条件下生成后续问题,确保问题的相关性与信息量。
- 设计了一套新的无需参考的格里森评分(Gricean Scores),基于格里森的准则,衡量问题的关联性、信息量、真实性、清晰度与连贯性。
- 知识选择器使用预训练的知识嵌入(如TransE)检索语义上相关知识,以确定问题的关注点。
- 该框架在新收集的人工标注数据集上进行训练与评估,数据集包含对话历史、背景知识以及人工编写的后续问题。
- 针对不同评估维度使用不同的预训练语言模型,以匹配其预训练目标并减少分布偏移。
实验结果
研究问题
- RQ1如何生成更具信息量、连贯性且与上下文相关的对话式调查后续问题?
- RQ2外部知识在多大程度上能提升生成的后续问题的质量与多样性?
- RQ3基于格里森原则的无需参考评估指标能否有效衡量后续问题的质量,而无需使用标准参考答案?
- RQ4基于知识的两阶段方法与基于GPT的基线模型相比,在生成高质量调查问题方面表现如何?
- RQ5知识与对话历史的结合是否能实现更个性化、目标导向的开放域调查问题生成?
主要发现
- 所提出的两阶段知识驱动模型生成的后续问题在信息量、连贯性与清晰度方面显著优于基于GPT的基线模型,该结论通过自动指标与人工评估均得到验证。
- 新数据集包含对话历史、标注的知识以及人工编写的后续问题,为知识驱动问题生成在对话式调查中的系统性研究提供了支持。
- 无需参考的格里森评分与人类判断具有良好的相关性,并提供了比BLEU或METEOR等标准自动指标更细致的洞察。
- 知识选择器能有效从Freebase中识别出相关联的实体-关系对,从而提升生成问题的关注点与相关性。
- 该框架在定量指标与定性分析中均优于竞争性基线模型,证明其在真实调查场景中的有效性。
- 局限性包括对通用知识库(如Freebase)的依赖,以及受知识嵌入质量限制导致的性能瓶颈,提示未来工作应探索领域特定的知识图谱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。