[论文解读] Natcat: Weakly Supervised Text Classification with Naturally Annotated Datasets.
本文提出 NatCat,一种弱监督文本分类框架,利用维基百科、Reddit 和 Stack Exchange 中自然产生的文档-类别配对来训练通用文本分类器。通过在这些社区整理的数据集上进行训练,并在 11 个基准任务上进行评估,作者表明不同数据源对特定分类任务具有独特优势,在无需人工标注的情况下提升了基线方法的性能。
We seek to improve text classification by leveraging naturally annotated data. In particular, we construct a general purpose text categorization dataset (NatCat) from three online resources: Wikipedia, Reddit, and Stack Exchange. These datasets consist of document-category pairs derived from manual curation that occurs naturally by their communities. We build general purpose text classifiers by training on NatCat and evaluate them on a suite of 11 text classification tasks (CatEval). We benchmark different modeling choices and dataset combinations, and show how each task benefits from different NatCat training resources.
研究动机与目标
- 为解决人工文本标注的高昂成本,利用在线社区中自然产生的文档-类别配对。
- 通过社区驱动的整理方式,从维基百科、Reddit 和 Stack Exchange 构建一个通用文本分类数据集(NatCat)。
- 评估不同组合的这些自然标注数据集对多样化文本分类任务性能的提升效果。
- 识别在特定分类任务中哪些数据源最为有效,从而在弱监督学习中实现资源选择的明智决策。
提出的方法
- 作者从维基百科、Reddit 和 Stack Exchange 收集文档-类别配对,其中类别通过用户驱动的标签和分类机制自然形成。
- 通过将这些自然标注的数据点聚合为统一的训练语料库,构建 NatCat 用于文本分类。
- 使用标准深度学习架构(如 BERT 或类似基于 Transformer 的模型)在 NatCat 上训练通用文本分类器。
- 在 11 个多样化的文本分类基准任务(CatEval)上评估训练好的模型,以评估其在不同领域中的性能表现。
- 分析每个数据源(维基百科、Reddit、Stack Exchange)对单个任务模型性能的贡献。
- 比较不同的建模选择和数据集组合,以识别特定分类任务的最优配置。
实验结果
研究问题
- RQ1由自然标注数据构建的 NatCat 数据集,在无需人工标注的情况下,能否显著提升文本分类性能?
- RQ2在维基百科、Reddit 和 Stack Exchange 三个数据源中,哪一个对特定文本分类任务的性能提升最为显著?
- RQ3不同的建模架构和数据集组合如何影响多样化 NLP 任务中的分类性能?
- RQ4在 NatCat 上训练的单一通用分类器,能否在多个下游文本分类任务中实现有效泛化?
主要发现
- 与在合成数据或人工标注数据上训练的模型相比,NatCat 在 11 个基准任务中显著提升了文本分类性能。
- 基于维基百科的数据在需要事实性与百科知识的任务中表现持续优异,例如实体分类和事件分类。
- 基于 Reddit 的数据在涉及非正式语言、情感分析和社会媒体文本的任务中表现更优,例如仇恨言论检测和反讽检测。
- 基于 Stack Exchange 的数据在技术性与领域特定的分类任务中尤为有效,例如代码相关分类或问答分类。
- 最优数据源因任务而异,没有单一数据源在所有基准测试中全面胜出,凸显了根据任务选择特定数据源的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。