Skip to main content
QUICK REVIEW

[论文解读] Improving Document Classification with Multi-Sense Embeddings

Vivek Gupta, Ankit Saw|arXiv (Cornell University)|Nov 18, 2019
Topic Modeling参考文献 42被引用 7
一句话总结

本文提出 SCDV-MS,一种新颖的文档表示方法,通过利用多义词嵌入和稀疏、低维流形学习,提升了文本分类性能。通过利用上下文消除词义歧义,直接对模糊聚类分配应用稀疏性,并将词-主题向量投影到低维空间,SCDV-MS 在多类和多标签文本分类任务中实现了最先进性能,同时相比 SCDV 降低了时间和空间复杂度。

ABSTRACT

Efficient representation of text documents is an important building block in many NLP tasks. Research on long text categorization has shown that simple weighted averaging of word vectors for sentence representation often outperforms more sophisticated neural models. Recently proposed Sparse Composite Document Vector (SCDV) (Mekala et. al, 2017) extends this approach from sentences to documents using soft clustering over word vectors. However, SCDV disregards the multi-sense nature of words, and it also suffers from the curse of higher dimensionality. In this work, we address these shortcomings and propose SCDV-MS. SCDV-MS utilizes multi-sense word embeddings and learns a lower dimensional manifold. Through extensive experiments on multiple real-world datasets, we show that SCDV-MS embeddings outperform previous state-of-the-art embeddings on multi-class and multi-label text categorization tasks. Furthermore, SCDV-MS embeddings are more efficient than SCDV in terms of time and space complexity on textual classification tasks.

研究动机与目标

  • 为解决 SCDV 的局限性,特别是其忽略词义歧义以及高维、噪声表示的问题。
  • 通过引入上下文敏感的多义词嵌入而非单义向量,改进文档表示。
  • 通过在词-主题向量层面而非最终文档向量上应用稀疏性,降低计算和存储成本。
  • 通过将文档嵌入投影到低维、连续且信息丰富的流形空间,使其更适用于深度学习流水线。

提出的方法

  • 用多义、上下文感知的嵌入替换单义词嵌入,以在文档表示过程中解决词义歧义问题。
  • 直接对模糊词聚类分配(词-主题向量)应用基于阈值的稀疏性,以减少噪声并提升效率。
  • 使用 Doc2VecC 初始化的鲁棒词向量,以抑制高频常见词(如 'the' 和 'and')带来的负面累积效应。
  • 利用自编码器将稀疏的词-主题向量投影到低维非线性流形空间,以保留局部邻域结构。
  • 学习连续的、低维的文档表示,使其在下游分类任务中更有效,并与深度学习架构兼容。
  • 通过自编码器降低词-主题向量的维度,从而在不显著损失性能的前提下实现更快的推理速度和更低的存储需求。

实验结果

研究问题

  • RQ1与单义嵌入相比,多义词嵌入是否能提升文档分类性能?
  • RQ2与在最终文档向量上应用稀疏性相比,在词-主题向量层面应用稀疏性是否能带来更好的性能和效率?
  • RQ3能否从稀疏的词-主题向量中学习到低维、连续的表示,同时保留语义结构?
  • RQ4常见词带来的噪声在多大程度上影响文档表示质量?能否被有效缓解?
  • RQ5在不牺牲分类性能的前提下,词-主题向量在多大程度上可通过降维压缩?

主要发现

  • SCDV-MS 在多类和多标签文本分类任务中优于 SCDV 和 BERT (pr),实现了最先进性能。
  • 与 SCDV 相比,SCDV-MS 在维度压缩过程中的性能损失显著更低,当从 12,000 维降至 2,000 维时,F1 分数仅下降 1%。
  • 由于词-主题向量具有极高的稀疏性(98% 稀疏),SCDV-MS 的特征构建时间相比 SCDV(仅 1% 稀疏)减少了 43 倍。
  • 当使用降维后的 R-SCDV-MS 向量(2,000 个稠密维度)时,预测时间减少了 8.5 倍,体现出卓越的效率。
  • R-SCDV-MS 的模型大小仅为 SCDV 的 6 倍,且训练速度提高了 1.25 倍,凸显了其更好的可扩展性。
  • SCDV-MS 的词-主题向量可直接作为 CNN 中的词嵌入使用,在 20Newsgroup 数据集上表现优于相同维度的原始词嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。