Skip to main content
QUICK REVIEW

[论文解读] AugESC: Dialogue Augmentation with Large Language Models for Emotional Support Conversation

Chujie Zheng, Sahand Sabour|arXiv (Cornell University)|Feb 26, 2022
Topic Modeling被引用 7
一句话总结

本文提出 AugESC,一种基于微调大型语言模型(LLMs)的大规模对话增强框架,用于情感支持对话(ESC)。通过将对话增强视为对话补全任务,该方法能从简短的帖子生成高质量、多样化的对话,显著扩大 ESConv 数据集的规模(45 倍)和主题覆盖范围。人工评估证实 AugESC 的质量与众包数据相当,且在其上微调可提升下游模型在开放领域主题上的泛化能力。

ABSTRACT

Crowdsourced dialogue corpora are usually limited in scale and topic coverage due to the expensive cost of data curation. This would hinder the generalization of downstream dialogue models to open-domain topics. In this work, we leverage large language models for dialogue augmentation in the task of emotional support conversation (ESC). By treating dialogue augmentation as a dialogue completion task, we prompt a fine-tuned language model to complete full dialogues from available dialogue posts of various topics, which are then postprocessed based on heuristics. Applying this approach, we construct AugESC, an augmented dataset for the ESC task, which largely extends the scale and topic coverage of the crowdsourced ESConv corpus. Through comprehensive human evaluation, we demonstrate that our approach is superior to strong baselines of dialogue augmentation and that AugESC has comparable dialogue quality to the crowdsourced corpus. We also conduct human interactive evaluation and prove that post-training on AugESC improves downstream dialogue models' generalization ability to open-domain topics. These results suggest the utility of AugESC and highlight the potential of large language models in improving data-scarce dialogue generation tasks.

研究动机与目标

  • 解决如 ESConv 等众包情感支持对话数据集规模有限且主题覆盖狭窄的问题。
  • 开发一种可扩展的、自动化的对话数据增强方法,用于情感敏感的 ESC 任务。
  • 评估 LLM 生成的对话是否能在情感支持场景中达到与人工筛选数据相当的质量。
  • 验证在增强数据上微调是否能提升下游模型在开放领域主题上的泛化能力。
  • 通过承认潜在偏差和有毒内容风险,确保合成数据的伦理使用。

提出的方法

  • 在现有 ESConv 对话样本上微调一个 6B 参数的 GPT-J 语言模型,以使其适应情感支持对话生成。
  • 使用微调后的 LLM,从从 EmpatheticDialogues 收集的、主题多样的简短对话帖子中补全完整对话。
  • 应用基于启发式规则的后处理方法,过滤并优化生成的对话,确保其连贯性、情感相关性与质量。
  • 通过将生成的对话与原始 ESConv 语料库结合,构建 AugESC,使数据集规模扩大 45 倍,主题覆盖更广。
  • 使用自动指标(PPL、BLEU、ROUGE-L、Distinct)和全面的人工评估,评估对话质量和模型泛化能力。
  • 开展人工交互评估,验证 AugESC 在提升下游模型在开放领域情感支持任务上性能方面的实用性。

实验结果

研究问题

  • RQ1基于 LLM 的对话增强能否生成质量可与人工筛选数据相媲美的高质量情感支持对话?
  • RQ2使用 LLM 生成的对话增强 ESConv 数据集,是否能显著提升下游对话模型在开放领域主题上的泛化能力?
  • RQ3所提出的对话补全方法在有效性与效率方面,相较于现有对话增强基线方法表现如何?
  • RQ4在 AugESC 上进行微调后,模型在原始 ESConv 测试集上的领域内性能保持程度如何?
  • RQ5在研究中使用合成的、LLM 生成的情感支持对话存在哪些伦理影响?

主要发现

  • 所提出的对话补全方法在人工评估和自动指标上均优于强基线模型,证明其在对话增强中具有更优的有效性与效率。
  • 通过全面的人工评估验证,AugESC 的对话质量与原始众包 ESConv 语料库相当。
  • 在 AugESC 上微调显著提升了下游对话模型在开放领域主题上的泛化能力,经人工交互评估确认。
  • 在 AugESC 上微调后,模型在 ESConv 测试集上保持了较强的领域内性能,自动指标(如困惑度 PPL 和 BLEU 分数)的下降幅度极小。
  • 增强后的数据集在规模上扩展了原始 ESConv 语料库的 45 倍,并显著拓宽了主题覆盖范围,使多样化的情感支持场景得以更好体现。
  • 尽管存在偏差和毒性内容的潜在风险,但通过透明的人工评估协议和明确的研究用途限制,支持 AugESC 的伦理使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。