Skip to main content
QUICK REVIEW

[论文解读] LST: Lexicon-Guided Self-Training for Few-Shot Text Classification

Hazel Kim, Jaeman Son|arXiv (Cornell University)|Feb 5, 2022
Text and Document Classification Technologies被引用 4
一句话总结

LST 提出了一种基于词典的自训练方法,用于少样本文本分类,通过整合语言学丰富的词汇知识,提升伪标签的可靠性。通过使用注意力加权的高频词来优化词典,并应用词汇数据增强,LST 在仅每类30个标注样本的情况下,在五个基准数据集上实现了当前最优性能,准确率相比之前方法提升1.0–2.0%。

ABSTRACT

Self-training provides an effective means of using an extremely small amount of labeled data to create pseudo-labels for unlabeled data. Many state-of-the-art self-training approaches hinge on different regularization methods to prevent overfitting and improve generalization. Yet they still rely heavily on predictions initially trained with the limited labeled data as pseudo-labels and are likely to put overconfident label belief on erroneous classes depending on the first prediction. To tackle this issue in text classification, we introduce LST, a simple self-training method that uses a lexicon to guide the pseudo-labeling mechanism in a linguistically-enriched manner. We consistently refine the lexicon by predicting confidence of the unseen data to teach pseudo-labels better in the training iterations. We demonstrate that this simple yet well-crafted lexical knowledge achieves 1.0-2.0% better performance on 30 labeled samples per class for five benchmark datasets than the current state-of-the-art approaches.

研究动机与目标

  • 解决由于有限标注数据导致的伪标签不可靠所引发的过自信和错误传播问题。
  • 通过引入超越模型置信度的结构化词汇知识,提升少样本文本分类中的伪标签可靠性。
  • 开发一种简单而有效的方法,利用词典实现置信度正则化、选择性采样和噪声注入,以优化自训练过程。
  • 证明经过优化的词典若具备语义有意义的词级层次结构(如同义词、上位词等),可显著提升模型在极小标注数据下的泛化能力。
  • 表明通过数据增强注入词汇知识可提升模型对未见样本的鲁棒性和性能。

提出的方法

  • 利用每个类别中注意力权重最高的词,从黄金标注数据中构建初始词典,以捕捉代表性术语。
  • 通过选择最自信的注意力加权词中频率最高的k%词汇,对词典进行优化,以平衡覆盖范围与可靠性。
  • 将优化后的词典用作置信度调节器,用于过滤和引导伪标签生成,降低错误预测中的过自信现象。
  • 通过优先选择其词汇与词典匹配的未标注样本,实现选择性采样,提升训练数据的信息量。
  • 利用 WordNet 对输入文本进行数据增强,生成语义相似的变体,以丰富词典并提升泛化能力。
  • 在教师-学生框架中迭代更新词典并重新训练模型,其中学生模型从标注数据和词典引导的伪标签中学习。

实验结果

研究问题

  • RQ1仅依赖模型置信度之外,语言学丰富的词典是否能提升少样本文本分类中伪标签的可靠性?
  • RQ2基于词典匹配的选择性采样在低资源设置下的自训练性能中起到何种作用?
  • RQ3词汇数据增强在多大程度上能增强模型泛化能力并减少自训练中的错误累积?
  • RQ4在少样本学习中,如何实现词典大小与词汇置信度之间的最优平衡以最大化性能?
  • RQ5将词汇知识作为置信度调节器,是否优于复杂的正则化技术在自训练中的文本分类表现?

主要发现

  • LST 在五个基准数据集上均达到当前最优性能,仅使用每类30个标注样本,准确率相比现有自训练方法提升1.0–2.0%。
  • 最佳性能出现在使用高注意力词中频率最高的10%词汇进行词典优化时,优于更小(1%)或更大(50%、100%)的词典规模。
  • 即使不使用数据增强,LST 的平均准确率仍比标准自训练高出3个百分点,证实词典在提升伪标签质量中的关键作用。
  • 词汇数据增强通过丰富词典并提升模型识别有意义未标注样本的能力,贡献了约1%的准确率增益。
  • 优化后的词典作为有效的置信度调节器和选择性采样器,减少了错误传播并提升了模型泛化能力。
  • 该方法在平均性能上显著优于 UDA(一种强大的数据增强基线)超过3个百分点,证明了词典引导学习的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。