Skip to main content
QUICK REVIEW

[论文解读] Guiding Generative Language Models for Data Augmentation in Few-Shot Text Classification

Aleksandra Edwards, Asahi Ushio|arXiv (Cornell University)|Nov 17, 2021
Topic Modeling被引用 5
一句话总结

本文通过战略性地选择种子样本,指导GPT-2在少样本文本分类中的数据增强,以提升生成数据的质量和分类器性能。结果表明,在如保护报告等专业领域中,基于专家知识的种子选择方法显著优于随机或启发式方法,且在基线模型上实现持续性能提升,同时提高了资源密集型生成任务的效率。

ABSTRACT

Data augmentation techniques are widely used for enhancing the performance of machine learning models by tackling class imbalance issues and data sparsity. State-of-the-art generative language models have been shown to provide significant gains across different NLP tasks. However, their applicability to data augmentation for text classification tasks in few-shot settings have not been fully explored, especially for specialised domains. In this paper, we leverage GPT-2 (Radford A et al, 2019) for generating artificial training instances in order to improve classification performance. Our aim is to analyse the impact the selection process of seed training examples have over the quality of GPT-generated samples and consequently the classifier performance. We perform experiments with several seed selection strategies that, among others, exploit class hierarchical structures and domain expert selection. Our results show that fine-tuning GPT-2 in a handful of label instances leads to consistent classification improvements and outperform competitive baselines. Finally, we show that guiding this process through domain expert selection can lead to further improvements, which opens up interesting research avenues for combining generative models and active learning.

研究动机与目标

  • 为解决少样本文本分类中的数据稀疏性和类别不平衡问题,特别是在需要专家标注的专业领域中。
  • 探究种子选择策略如何影响GPT-2生成的训练实例质量及下游分类器性能。
  • 评估人工参与的种子选择、层次结构利用以及基于名词频率的种子选择在提升数据增强效果方面的有效性。
  • 证明仅在少量标注样本上对GPT-2进行标签保持微调,可优于在全量数据集上进行微调。
  • 探索主动学习与生成模型之间的协同作用,以实现在低资源、依赖专家的领域中高效且高质量的数据增强。

提出的方法

  • 仅使用少量标注样本对每个类别微调GPT-2,以在文本生成过程中保留类别信息。
  • 实施人机协同的种子选择流程,由领域专家选择具有代表性且能指示类别的训练样本作为提示。
  • 基于专家构建的数据集层次结构开发种子选择策略,以提升顶层类别的分类性能。
  • 采用基于名词频率的方法,选择词汇丰富度较高的种子,假设此类词汇更可能体现类别特征。
  • 将所选种子作为提示生成合成训练数据,并在增强后的数据集上微调分类器。
  • 在句子级和篇章级分类任务中,对比随机种子选择、基于启发式策略的种子选择以及专家引导的种子选择的性能表现。

实验结果

研究问题

  • RQ1在少样本文本分类中,不同种子选择策略对生成训练数据质量的影响如何?
  • RQ2在专业领域中,基于专家知识的种子选择是否能显著提升分类器性能,优于随机或启发式方法?
  • RQ3仅在每个类别的少量标注样本上微调GPT-2,是否能获得优于在全量数据集上微调的性能?
  • RQ4在使用资源密集型生成模型时,种子选择策略如何影响数据增强的效率与效果?
  • RQ5在低资源、依赖专家的领域中,将主动学习与生成模型结合,能在多大程度上提升数据增强效果?

主要发现

  • 人机协同的种子选择策略在句子级和篇章级分类任务中,均显著优于其他所有种子选择方法及基线模型。
  • 仅在每个类别的少量标注样本上微调GPT-2,可带来一致的性能提升,且优于在全量数据集上微调的模型。
  • 基于专家构建的类别层次结构的种子选择策略,显著提升了顶层类别的分类性能,尤其在结构化、主题性较强的领域中表现突出。
  • 基于名词频率的种子选择方法显示出可测量的优势,尽管不及专家引导的选择策略,但仍表明词汇丰富度是类别指示性内容的有用代理指标。
  • 在通用领域数据集(如20 Newsgroups)中,随机种子选择已足够,但在保护报告等专业领域中则无效,凸显了领域依赖性。
  • 本研究证实,将专家知识整合到文本生成流程中,可显著提升数据增强的质量与效率,尤其在高风险、低资源的领域中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。