[论文解读] Controllable Mixed-Initiative Dialogue Generation through Prompting
本文提出使用少样本提示(few-shot prompting)与大语言模型(LLMs)作为可控混合主动性对话生成中微调的即插即用替代方案。实验表明,在人类评估和自动指标上,基于提示的LLM在两项任务(情感支持对话与P4G说服任务)中均优于微调模型和真实标注响应。
Mixed-initiative dialogue tasks involve repeated exchanges of information and conversational control. Conversational agents gain control by generating responses that follow particular dialogue intents or strategies, prescribed by a policy planner. The standard approach has been fine-tuning pre-trained language models to perform generation conditioned on these intents. However, these supervised generation models are limited by the cost and quality of data annotation. We instead prompt large language models as a drop-in replacement to fine-tuning on conditional generation. We formalize prompt construction for controllable mixed-initiative dialogue. Our findings show improvements over fine-tuning and ground truth responses according to human evaluation and automatic metrics for two tasks: PersuasionForGood and Emotional Support Conversations.
研究动机与目标
- 为解决微调模型在可控对话生成中的局限性,如标注成本高、对数据质量与分布偏移敏感等问题。
- 探究预训练LLM的少样本提示是否能实现优于监督微调的控制力与响应质量。
- 评估提示工程在使LLM生成符合特定对话策略响应方面在混合主动性场景中的有效性。
- 在自动指标与人类评估指标下,对比基于提示的LLM与微调模型及人工标注真实响应的表现。
提出的方法
- 通过设计结构化的少样本提示,将对话历史与期望策略作为条件,形式化构建可控混合主动性对话的提示。
- 利用上下文学习,通过少量示例引导LLM生成符合特定对话策略(如复述、共情、引导)的响应。
- 利用GPT-3等大规模预训练语言模型作为零样本或少样本生成头,替代任务特定的微调需求。
- 设计包含对话历史、目标策略及示例响应对的提示,以引导模型输出。
- 在两个基准数据集(情感支持对话ESC与P4G说服任务P4G)上进行评估,结合自动指标与人类评估。
- 对比基于提示的LLM方法与微调模型(如Oracle-BlenderBot)及人工标注真实响应的表现。
实验结果
研究问题
- RQ1在混合主动性场景中,LLM的少样本提示能否有效生成与特定对话策略对齐的响应?
- RQ2基于提示的LLM生成在响应质量与策略遵循度方面与微调模型相比如何?
- RQ3当训练数据存在噪声或分布偏移时,使用上下文示例的提示是否能提升生成质量,优于微调方法?
- RQ4基于提示的LLM能否在无需任务特定微调的情况下实现人类水平的响应质量与策略控制?
- RQ5该提示方法对用户输入的变化(包括低资源或非流畅语言模式)的鲁棒性如何?
主要发现
- 在情感支持对话数据集上,基于提示的LLM在人类评估中表现优于微调模型与真实标注响应。
- 在P4G数据集上,基于提示的LLM在自动指标与人类评估中均优于微调模型,尤其在说服力与连贯性方面表现更优。
- 人类评估者认为,基于提示的LLM响应比微调模型更自然、更一致、更连贯,即使后者使用了真实策略标签进行训练。
- 该方法对分布偏移与标注噪声表现出鲁棒性,LLM在未微调的情况下仍能更好地泛化到多样化的对话情境。
- 在非流畅或低资源用户输入情况下,基于提示的LLM保持了高质量与连贯性,而微调模型则在分布外输入上表现不佳。
- 研究发现,通过精心设计的上下文示例提示,LLM能够以高保真度有效模拟复述、共情与引导等复杂对话策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。