Skip to main content
QUICK REVIEW

[论文解读] Investigating the Effectiveness of Representations Based on Word-Embeddings in Active Learning for Labelling Text Datasets

Jinghui Lu, Maeve Henchion|arXiv (Cornell University)|Oct 4, 2019
Topic Modeling参考文献 40被引用 8
一句话总结

本文评估了基于词嵌入的表示方法——特别是 BERT——在文本分类主动学习中的应用,表明 BERT 显著优于传统的 TF-IDF 和词袋模型。在 8 个不同数据集上采用不确定性采样和 QBC 策略,BERT 取得了最高的平均排名(2.81),并持续超越基线表示方法,证明现代上下文嵌入能显著提升文本标注任务中主动学习的效率。

ABSTRACT

Manually labelling large collections of text data is a time-consuming, expensive, and laborious task, but one that is necessary to support machine learning based on text datasets. Active learning has been shown to be an effective way to alleviate some of the effort required in utilising large collections of unlabelled data for machine learning tasks without needing to fully label them. The representation mechanism used to represent text documents when performing active learning, however, has a significant influence on how effective the process will be. While simple vector representations such as bag of words have been shown to be an effective way to represent documents during active learning, the emergence of representation mechanisms based on the word embeddings prevalent in neural network research (e.g. word2vec and transformer-based models like BERT) offer a promising, and as yet not fully explored, alternative. This paper describes a large-scale evaluation of the effectiveness of different text representation mechanisms for active learning across 8 datasets from varied domains. This evaluation shows that using representations based on modern word embeddings---especially BERT---, which have not yet been widely used in active learning, achieves a significant improvement over more commonly used vector-based methods like bag of words.

研究动机与目标

  • 评估现代词嵌入表示方法(尤其是 BERT)在文本分类主动学习中的有效性。
  • 比较基于嵌入的表示方法(如 BERT、FastText)与传统向量表示方法(如 TF-IDF、词袋模型、LDA)在主动学习设置下的表现。
  • 评估最先进的上下文嵌入是否能提升低标签预算场景下的标注效率和模型性能。
  • 确定在文本数据集中最有效的表示与选择策略组合。
  • 提供实证证据,证明无需在循环中进行端到端神经网络训练,深度学习表示方法也可在主动学习中有效应用。

提出的方法

  • 采用基于池的主动学习框架,即以少量标注样本作为初始种子,迭代选择未标注样本交由人工标注。
  • 使用多种文本表示技术:TF-IDF、词袋模型(TF)、LDA、FastText(FT)、带训练的 FastText(FT_T),以及 BERT 进行文档编码。
  • 应用四种主动学习选择策略:不确定性采样、基于委员会的查询(QBC)、信息密度(ID)和密度加权采样。
  • 在涵盖产品评论、新闻和博客文章等领域的 8 个多样化文本数据集上开展大规模实验,以确保结果的泛化能力。
  • 使用宏平均 F1 分数评估性能,并对各数据集的平均排名进行统计显著性检验(Wilcoxon signed-rank test)。
  • 使用 t-SNE 可视化分析嵌入空间中表示的聚类质量,评估在无标签信息情况下的类别可分性。

实验结果

研究问题

  • RQ1与 TF-IDF 和词袋模型等传统向量表示相比,基于词嵌入的表示方法(尤其是 BERT)是否能提升文本分类中主动学习的性能?
  • RQ2在多样化文本数据集中,哪种表示与选择策略的组合能实现最高的标注效率和模型性能?
  • RQ3不同表示方法的内在聚类特性(如 BERT 与 LDA)如何影响主动学习结果?
  • RQ4在多个数据集上,基于嵌入的方法相较于经典方法的性能提升是否具有统计显著性?
  • RQ5BERT 是否可以作为文本标注任务中主动学习流程的默认表示方法被可靠使用?

主要发现

  • 基于 BERT 的表示在所有数据集和选择策略下取得了最高的平均排名(2.81),显著优于所有基线方法。
  • BERT 配合不确定性采样在整体表现上最佳,在与 TF-IDF 和 TF 的成对显著性检验中,8 次比较全部获胜(p < 0.05)。
  • 所有基于嵌入的方法(BERT、FastText 等)均显著优于 TF、TF-IDF 和 LDA(p < 0.05),表明语义表示带来了持续的性能增益。
  • 尽管性能优异,但各类基于嵌入的方法之间未发现显著差异,表明优势源于嵌入范式本身,而非特定模型架构。
  • t-SNE 可视化结果证实,BERT 表示能生成分离良好且类别一致的聚类,而 TF-IDF 和 LDA 表示则表现出高度重叠和较差的类别分离。
  • LDA 表示性能较差,可能由于主题间类别混杂,且显著落后于所有基于嵌入的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。