[论文解读] Weakly Supervised Data Augmentation Through Prompting for Dialogue Understanding
本文提出 WeakDAP,一种弱监督数据增强框架,利用大语言模型的 few-shot prompting 生成高质量对话话语,用于低资源对话理解任务。通过迭代地使用基于熵的不确定性评分过滤合成数据,WeakDAP 仅使用原始训练数据的 10% 即可提升模型性能,在 DailyDialog 上超越全量数据的最先进模型,并在 FBTOD 的跨语言意图检测任务中取得优异结果。
Dialogue understanding tasks often necessitate abundant annotated data to achieve good performance and that presents challenges in low-resource settings. To alleviate this barrier, we explore few-shot data augmentation for dialogue understanding by prompting large pre-trained language models and present a novel approach that iterates on augmentation quality by applying weakly-supervised filters. We evaluate our methods on the emotion and act classification tasks in DailyDialog and the intent classification task in Facebook Multilingual Task-Oriented Dialogue. Models fine-tuned on our augmented data mixed with few-shot ground truth data are able to approach or surpass existing state-of-the-art performance on both datasets. For DailyDialog specifically, using 10% of the ground truth data we outperform the current state-of-the-art model which uses 100% of the data.
研究动机与目标
- 为解决标注数据稀缺且获取成本高昂的低资源对话理解挑战。
- 通过使用预训练语言模型生成合成对话轮次,提升对话分类任务的数据效率。
- 通过弱监督机制(基于熵的过滤)提升生成对话数据的质量,剔除低质量或分布外样本。
- 证明仅使用原始训练数据一小部分(如 10%)结合 few-shot prompting 与迭代过滤,即可实现最先进性能。
- 在单语(DailyDialog)与多语(FBTOD)对话理解任务上验证该方法的有效性。
提出的方法
- 采用前缀 prompting 技术,利用大规模预训练语言模型(如 GPT-J)生成基于对话上下文的新对话轮次。
- 采用三种增强策略:对话轨迹增强(CTA)、全轮次增强(ATA)和最后一轮增强(LTA),分别调整上下文在生成中的使用方式。
- 基于熵的弱监督过滤器用于识别并保留不确定性高、难以分类的样本,假设此类样本有助于提升模型泛化能力。
- 过滤器以迭代方式运行:先生成合成数据,再进行分类,仅保留不确定性高(熵值高)的样本用于后续微调。
- 该框架应用于 DailyDialog 的情感与对话行为分类任务,以及 FBTOD 的意图分类任务,微调使用 XLMRoBERTa 模型。
- 通过在英语中进行 prompting 并生成西班牙语训练样本,实现跨语言增强,利用多语言模型的上下文学习能力。
实验结果
研究问题
- RQ1大语言模型的 few-shot prompting 是否能生成高质量对话话语,从而提升下游对话理解性能?
- RQ2基于熵的弱监督过滤是否能有效提升合成对话数据质量,而无需昂贵的人工标注?
- RQ3仅使用一小部分真实数据(如 10%)结合合成数据,在多大程度上可实现与全量数据训练相当或更优的性能?
- RQ4所提方法是否能在不同对话理解任务与语言设置(包括跨语言场景)中泛化?
- RQ5在低资源设置下,包含不确定、难学习样本是否有助于提升模型的泛化能力与鲁棒性?
主要发现
- 仅使用 DailyDialog 原始训练数据的 10%,WeakDAP 在情感分类与对话行为分类任务上均超越当前全量数据的最先进模型。
- 在 WeakDAP 增强数据上微调的模型,性能达到或优于在 100% 原始数据上训练的模型。
- 在 FBTOD 数据集上,通过英语 prompt 生成西班牙语训练样本的跨语言增强,显著提升了意图检测性能,尤其在低数据设置(1%、5%、10%)下表现更优。
- 基于熵的过滤成功识别并保留了难学习样本,这些样本在迭代训练中显著提升了模型泛化能力。
- 该方法在不同对话理解任务中表现出强鲁棒性,且在极低监督与计算成本下仍具有效性。
- 消融实验表明,prompting 与 filtering 两个组件均不可或缺,任一移除均导致性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。