[论文解读] LIME: Weakly-Supervised Text Classification Without Seeds
LIME 提出了一种新颖的弱监督文本分类框架,该框架用基于蕴含关系的分类方法替代了基于种子词的伪标签生成方法,利用现成的文本蕴含模型进行分类。通过利用蕴含关系分配伪标签并应用自训练,LIME 在四个基准数据集上实现了最先进性能,部分数据集上相比之前的方法最高提升了10个F1分数点。
In weakly-supervised text classification, only label names act as sources of supervision. Predominant approaches to weakly-supervised text classification utilize a two-phase framework, where test samples are first assigned pseudo-labels and are then used to train a neural text classifier. In most previous work, the pseudo-labeling step is dependent on obtaining seed words that best capture the relevance of each class label. We present LIME, a framework for weakly-supervised text classification that entirely replaces the brittle seed-word generation process with entailment-based pseudo-classification. We find that combining weakly-supervised classification and textual entailment mitigates shortcomings of both, resulting in a more streamlined and effective classification pipeline. With just an off-the-shelf textual entailment model, LIME outperforms recent baselines in weakly-supervised text classification and achieves state-of-the-art in 4 benchmarks. We open source our code at https://github.com/seongminp/LIME.
研究动机与目标
- 解决基于种子词的伪标签生成在弱监督文本分类中存在脆弱性和不灵活性的问题。
- 探究基于蕴含关系的分类是否能提供比关键词匹配更鲁棒且更具适应性的伪标签。
- 研究伪标签置信度阈值对低资源环境下自训练性能的影响。
- 证明结合基于蕴含关系的标签生成与自训练可提升分类准确率与鲁棒性。
- 提供一种简化、无需种子词的端到端流程,无需任务特定的种子词筛选即可超越现有弱监督基线方法。
提出的方法
- 用文本蕴含模型替代传统种子词生成方法,为测试样本分配伪标签。
- 将每个类别标签表述为一个假设(例如,'该文本是关于<label>的'),并计算测试文档与每个假设之间的蕴含分数。
- 将蕴含分数最高的假设作为该测试样本的伪标签。
- 使用自训练方法在伪标签数据集上训练独立的神经网络文本分类器,以优化预测结果。
- 应用置信度阈值过滤低置信度的伪标签,以在数据集大小与标签质量之间取得平衡。
- 使用现成的预训练蕴含模型(如基于DeBERTa的模型)而无需微调,实现即插即用的部署。
实验结果
研究问题
- RQ1基于蕴含关系的伪标签生成是否能在弱监督文本分类中超越基于种子词的方法?
- RQ2基于蕴含关系的伪标签置信度与下游分类准确率之间是否存在相关性?
- RQ3在过滤低置信度伪标签与保留足够训练数据以支持自训练之间,如何实现最佳平衡?
- RQ4自训练是否能缓解在多样化领域中纯基于蕴含关系分类所表现出的鲁棒性问题?
- RQ5一种无需种子词、完全基于蕴含关系的端到端流程能否在弱监督文本分类中实现最先进性能?
主要发现
- LIME 在四个标准基准数据集上达到最先进性能:20News(79.74/79.56 micro/macro-F1)、AGNews(87.21/87.16)、Yelp(95.22/95.22)和 DBpedia(92.19/92.20),优于先前的最先进方法。
- 最终的自训练分类器相比原始蕴含分类器,F1分数提升了约10分,证明了自训练在错误纠正方面的有效性。
- 伪标签的平均置信度越高,蕴含分类器与自训练模型的分类准确率也越高,二者呈现强相关性。
- 置信度阈值在50%至70%之间时,可在标签质量与训练集规模之间取得最佳平衡,性能在70%阈值时达到峰值。
- 该框架对领域分布变化具有鲁棒性,且无需针对任务进行种子词筛选,优于以往方法。
- LIME 的性能接近监督基线模型,尤其在 Yelp 数据集上(95.22 F1),表明其在低资源设置下具备强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。