[论文解读] Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations
本研究调查了大型语言模型(LLMs)在生成文本分类合成数据方面的有效性,发现随着任务和实例主观性的增加,模型在合成数据上的表现显著下降。通过提供少量真实世界示例来引导LLMs可提升性能,但像反讽检测这类高主观性任务仍具挑战性,原因在于数据多样性有限以及人类细微解读的复杂性。
The collection and curation of high-quality training data is crucial for developing text classification models with superior performance, but it is often associated with significant costs and time investment. Researchers have recently explored using large language models (LLMs) to generate synthetic datasets as an alternative approach. However, the effectiveness of the LLM-generated synthetic data in supporting model training is inconsistent across different classification tasks. To better understand factors that moderate the effectiveness of the LLM-generated synthetic data, in this study, we look into how the performance of models trained on these synthetic data may vary with the subjectivity of classification. Our results indicate that subjectivity, at both the task level and instance level, is negatively associated with the performance of the model trained on synthetic data. We conclude by discussing the implications of our work on the potential and limitations of leveraging LLM for synthetic data generation.
研究动机与目标
- 评估LLM生成的合成数据在训练文本分类模型方面与真实世界数据相比的有效性。
- 研究任务层面和实例层面的主观性如何调节基于合成数据训练的模型性能。
- 比较零样本提示和少样本提示策略在合成数据生成中的应用,以提升模型泛化能力。
- 理解尽管LLM具备高质量生成能力,为何其生成的合成数据在高度主观的分类任务上仍表现不佳。
- 探讨在低资源或零样本学习场景下,合成数据生成的潜在影响。
提出的方法
- 使用GPT-3.5-Turbo对10个多样化的文本分类任务,分别采用零样本和少样本提示生成合成文本实例。
- 通过直接指令LLM生成特定标签的实例,而无需示例,应用零样本提示。
- 通过提供少量真实世界标注示例,引导LLM生成更具上下文准确性的合成数据,应用少样本提示。
- 在合成数据集和真实世界数据集上分别训练文本分类模型,以比较不同任务下的性能表现。
- 使用标准指标(如F1-score)衡量模型性能,并将结果与任务层面和实例层面的主观性评分进行相关性分析。
- 收集人工标注的主观性评分以量化实例层面的主观性,通过众包工作者评估标签一致性。
实验结果
研究问题
- RQ1任务层面的主观性如何影响基于LLM生成的合成数据训练的文本分类模型性能?
- RQ2实例层面的主观性(即人工标注者意见不一致)与模型在合成数据上的性能之间是否存在相关性?
- RQ3与零样本提示相比,少样本提示是否能提升LLM生成的合成数据的质量和有效性?
- RQ4是否存在某些类型的分类任务,使得合成数据的性能可与真实世界数据相媲美?
- RQ5LLM在捕捉细微、主观的语言模式(如反讽或幽默)方面存在哪些局限性?
主要发现
- 在大多数任务中,基于LLM生成的合成数据训练的模型表现显著劣于基于真实世界数据训练的模型,尤其在反讽和幽默检测等高主观性任务上表现更差。
- 与零样本提示相比,少样本提示提升了模型在合成数据上的表现,表明即使少量真实示例也能增强数据质量和模型泛化能力。
- 在低主观性任务(如新闻主题分类和垃圾信息检测)中,基于合成数据训练的模型性能接近于基于真实数据训练的模型。
- 在同一任务中,基于合成数据训练的模型在主观性较低的实例上表现更好,这些实例的人工标注者一致性更高。
- Financial Phrasebank和Sarcasm数据集在不同主观性水平下性能变化极小,可能是因为领域特定术语的存在,以及零样本生成缺乏领域知识所致。
- 研究发现任务/实例主观性与模型在合成数据上的性能之间存在强烈负相关性,表明主观性是影响合成数据有效性的关键调节因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。