Skip to main content
QUICK REVIEW

[论文解读] An empirical study on large scale text classification with skip-gram embeddings

Georgios Balikas, Massih-Réza Amini|arXiv (Cornell University)|Jun 21, 2016
Text and Document Classification Technologies参考文献 30被引用 14
一句话总结

本文提出一种混合方法,通过融合skip-gram词嵌入与传统的tf-idf或one-hot编码特征,实现大规模文本分类。它评估了简单的组合函数(平均、最大值、最小值)以生成文档级表征,并表明将这些表征与tf-idf特征拼接可显著提升F1分数——最高提升3.5分,尤其在具有高达10,000个类别的高基数多分类设置中表现突出。

ABSTRACT

We investigate the integration of word embeddings as classification features in the setting of large scale text classification. Such representations have been used in a plethora of tasks, however their application in classification scenarios with thousands of classes has not been extensively researched, partially due to hardware limitations. In this work, we examine efficient composition functions to obtain document-level from word-level embeddings and we subsequently investigate their combination with the traditional one-hot-encoding representations. By presenting empirical evidence on large, multi-class, multi-label classification problems, we demonstrate the efficiency and the performance benefits of this combination.

研究动机与目标

  • 研究skip-gram词嵌入作为大规模文本分类(含数千个类别)中特征的有效性。
  • 评估简单的组合函数(平均、最大值、最小值)将词级嵌入转换为文档级表征的性能。
  • 评估在高维、多标签分类任务中,将分布式嵌入与传统的one-hot或tf-idf表征融合所带来的性能提升。
  • 通过使用预训练嵌入,缓解在大规模词汇量、高基数文本分类问题中训练深度神经网络时的硬件限制。
  • 证明嵌入与tf-idf特征融合可在多个数据集上实现统计显著且可扩展的性能提升。

提出的方法

  • 使用预训练的skip-gram词嵌入(D=100, 200, 400)作为文档表征组合的输入。
  • 对词向量逐元素应用三种组合函数——平均、最大值和最小值,以生成文档级嵌入。
  • 将文档表征构建为拼接形式:z_conc(doc) = [z_avg(doc), z_min(doc), z_max(doc)]。
  • 通过拼接将生成的文档级嵌入与tf-idf或哈希编码的one-hot特征结合,作为最终分类的输入。
  • 在融合的特征空间上使用标准分类器(如SVM),并通过哈希将维度降低至70,000个特征,以控制规模。
  • 使用F1分数评估性能,并通过双侧t检验(p < 0.01)验证性能提升的统计显著性。

实验结果

研究问题

  • RQ1在大规模文本分类中,简单组合函数(平均、最大值、最小值)将词级skip-gram嵌入转换为文档级表征的有效性如何?
  • RQ2将预训练的skip-gram嵌入与传统的tf-idf或one-hot特征结合,是否能提升在最多10,000个类别的数据集上的分类性能?
  • RQ3融合表征的性能如何随标签空间基数和嵌入维度的增加而变化?
  • RQ4在多个大规模文本分类基准上,融合带来的性能提升是否具有统计显著性?
  • RQ5在高维设置中,特征表征的选择(tf-idf vs. 哈希 vs. 嵌入)在可扩展性与准确性方面的影响有多大?

主要发现

  • 与仅使用tf-idf相比,将tf-idf特征与拼接的skip-gram嵌入(D=400)融合后,PubMed 10,000数据集上的F1分数提升了3.5分。
  • 在所有评估的数据集中,包括PubMed 10,000,将嵌入与tf-idf结合带来的性能提升均具有统计显著性(p < 0.01)。
  • 在PubMed 1,000数据集中,融合模型的性能与仅使用tf-idf相当,但随着类别数量的增加,性能增益更加显著。
  • 当与tf-idf融合时,最优嵌入维度(D)的影响减弱,表明实践中较低维度的嵌入(D < 400)可能已足够。
  • 基于哈希的one-hot编码表征表现不如tf-idf,但仍能从与嵌入的融合中显著获益——F1分数最高提升3.5分。
  • 通过平均、最小值和最大值函数组合词嵌入在计算上高效且天然可并行化,从而可扩展至包含10,000个类别的大规模数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。