Skip to main content
QUICK REVIEW

[论文解读] Selective Text Augmentation with Word Roles for Low-Resource Text Classification

Biyang Guo, Songqiao Han|arXiv (Cornell University)|Sep 4, 2022
Text and Document Classification Technologies被引用 6
一句话总结

本文提出选择性文本增强(STA),一种新颖的低资源文本分类数据增强方法。该方法基于统计相关性和语义相似度,将词语分类为四种角色——黄金(Gold)、冒险(Venture)、奖励(Bonus)和琐碎(Trivial)。STA根据词语角色选择性地应用文本编辑操作,保留核心语义的同时生成多样化、高质量的训练样本,从而在低资源基准上实现最高达5%的准确率提升,并在跨数据集泛化任务中实现超过4%的平均性能增益。

ABSTRACT

Data augmentation techniques are widely used in text classification tasks to improve the performance of classifiers, especially in low-resource scenarios. Most previous methods conduct text augmentation without considering the different functionalities of the words in the text, which may generate unsatisfactory samples. Different words may play different roles in text classification, which inspires us to strategically select the proper roles for text augmentation. In this work, we first identify the relationships between the words in a text and the text category from the perspectives of statistical correlation and semantic similarity and then utilize them to divide the words into four roles -- Gold, Venture, Bonus, and Trivial words, which have different functionalities for text classification. Based on these word roles, we present a new augmentation technique called STA (Selective Text Augmentation) where different text-editing operations are selectively applied to words with specific roles. STA can generate diverse and relatively clean samples, while preserving the original core semantics, and is also quite simple to implement. Extensive experiments on 5 benchmark low-resource text classification datasets illustrate that augmented samples produced by STA successfully boost the performance of classification models which significantly outperforms previous non-selective methods, including two large language model-based techniques. Cross-dataset experiments further indicate that STA can help the classifiers generalize better to other datasets than previous methods.

研究动机与目标

  • 解决非选择性文本增强方法的局限性,后者可能扭曲与标签相关的词语或放大噪声。
  • 识别并形式化文本分类中词语的功能角色,结合统计相关性和语义相似度两种互补视角。
  • 开发一种选择性增强框架,根据不同词语角色应用差异化的编辑操作,以在保持语义的同时提升多样性。
  • 提升模型泛化能力,特别是在数据分布发生变化的跨数据集设置下。
  • 提供一种简单而有效的方案,在多个低资源文本分类基准上超越非选择性增强基线方法。

提出的方法

  • 利用统计共现关系和语义嵌入相似度,将每段文本中的词语分类为四种角色:黄金(高相关性,高相似度)、冒险(高相关性,低相似度)、奖励(低相关性,高相似度)和琐碎(低相关性,低相似度)。
  • 统计相关性通过词语存在与类别标签之间的点双列相关系数进行度量。
  • 语义相似度通过句子-BERT嵌入计算,将词语表征与类别描述进行比较。
  • STA根据每个词语的角色应用不同的文本编辑操作(如替换、插入或删除):黄金词语被最小程度修改,琐碎词语更可能被修改,而冒险/奖励词语则被选择性编辑以增强多样性。
  • 根据数据集特性采用全局或局部策略进行词语选择,其中全局策略更倾向于利用高频的角色模式。
  • 该方法轻量化且与现有增强流水线兼容,可轻松集成至标准NLP模型中。

实验结果

研究问题

  • RQ1词语与类别之间的统计相关性与语义相似性如何相互作用?二者能否用于定义文本分类中有意义的词语角色?
  • RQ2基于词语角色的选择性文本增强是否能相比非选择性方法提升低资源文本分类的模型性能?
  • RQ3选择性应用增强操作在多大程度上能保留核心语义,同时增强训练数据的多样性?
  • RQ4所提出的STA方法在不同数据集之间如何泛化,特别是在训练与测试数据分布不一致的情况下?
  • RQ5统计相关性与语义相似度在确定有效词语角色用于增强时,各自贡献如何?

主要发现

  • 当仅使用50个训练样本时,STA在低资源文本分类任务上平均准确率提升近5%;当使用100个样本时,提升达2.6%。
  • 在三个基准数据集上,STA在跨数据集泛化任务中平均性能优于非选择性基线方法EDA-w2v超过4%。
  • 消融实验表明,在角色识别过程中移除任一因素(统计相关性或语义相似度)均导致性能下降,其中语义相似度对有效词语角色分类的贡献更为显著。
  • 在跨数据集泛化任务中,STA平均准确率达到62.12%,而EDA-w2v为58.04%,表明其对未见数据分布具有更强的泛化能力。
  • 该方法通过选择性编辑有效净化了训练数据——尤其通过修改琐碎和奖励词语,同时保持黄金词语的语义完整性。
  • 结果证实,基于词语角色的增强方法比非选择性方法更有效,因其在保持标签保真度的同时显著提升了数据多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。