Skip to main content
QUICK REVIEW

[论文解读] Exploring text datasets by visualizing relevant words

Franziska Horn, Leila Arras|arXiv (Cornell University)|Jul 17, 2017
Topic Modeling参考文献 11被引用 8
一句话总结

本文提出使用词云可视化文本数据集中的'相关词汇',以加速探索性数据分析。比较了三种方法——tf-idf聚合、逐层显著性传播(LRP)和一种新颖的词频比得分——以识别每类或每簇的区分性词汇,结果表明频次比方法在科学出版物和《纽约时报》片段中的趋势话题识别中最佳揭示了显著主题。

ABSTRACT

When working with a new dataset, it is important to first explore and familiarize oneself with it, before applying any advanced machine learning algorithms. However, to the best of our knowledge, no tools exist that quickly and reliably give insight into the contents of a selection of documents with respect to what distinguishes them from other documents belonging to different categories. In this paper we propose to extract `relevant words' from a collection of texts, which summarize the contents of documents belonging to a certain class (or discovered cluster in the case of unlabeled datasets), and visualize them in word clouds to allow for a survey of salient features at a glance. We compare three methods for extracting relevant words and demonstrate the usefulness of the resulting word clouds by providing an overview of the classes contained in a dataset of scientific publications as well as by discovering trending topics from recent New York Times article snippets.

研究动机与目标

  • 为解决缺乏能够快速揭示文本数据集中不同类别或簇之间文档差异的工具的问题。
  • 在应用复杂机器学习模型之前,实现对数据集内容的快速、直观理解。
  • 识别并可视化每个类别或簇的显著区分性词汇,以支持探索性分析。
  • 评估多种提取相关词汇的方法,并确定哪种方法最能捕捉文本数据中的有意义差异。
  • 在标注数据集(如科学出版物)和未标注数据集(如近期新闻片段)中均展示其在趋势检测中的实用性。

提出的方法

  • 通过分词、去除停用词,并转换为tf-idf特征向量,对文本数据进行预处理。
  • 应用三种方法提取相关词汇:(1) 按类别汇总tf-idf得分,(2) 使用逐层显著性传播(LRP)将分类器得分归因于输入特征,(3) 基于目标类别与其他类别相比的相对频率计算词汇显著性得分。
  • 使用每种方法提取的排名靠前的相关词汇,为每个类别或簇生成词云。
  • 对于未标注数据,使用余弦相似度阈值为0.55、最小簇大小为3的DBSCAN算法对文档进行聚类。
  • 在单个文档中高亮相关词汇,以解释分类决策并检测训练集中的偏差。
  • 使用开源Python库'textcatvis'复现实验并可视化结果。

实验结果

研究问题

  • RQ1哪种方法最可靠地识别出能将特定类别中的文档与其它类别区分开来的词汇?
  • RQ2基于相关词汇的词云是否能无需完整模型训练,就提供数据集内容的直观、高层次概览?
  • RQ3不同词汇显著性提取技术在识别未标注新闻文本数据中的趋势话题方面有多高效?
  • RQ4可视化相关词汇是否有助于检测训练数据中的偏差或误分类?
  • RQ5各方法在类别大小不平衡或簇较小的数据集中性能表现如何?

主要发现

  • 基于目标类别中词汇相对出现频率计算显著性得分的频次比方法,在标注和未标注数据集的探索性分析中均优于tf-idf聚合和LRP方法。
  • 使用频次比方法生成的词云在2017年1月《纽约时报》文章片段中,清晰揭示了'总统就职'、'特朗普'和'抗议'等显著主题。
  • 该方法即使在簇中仅包含三篇文档的情况下,也能成功识别出与真实世界事件(如贝齐·德沃斯提名和意大利雪崩)相对应的独立簇。
  • LRP在解释单个分类决策和识别导致误分类的特征方面最为有效,尤其是在训练模型中。
  • tf-idf聚合方法常无法区分类别特异性词汇,特别是在词汇在多个类别中均常见时。
  • 该方法实现了对数据集结构的快速、人类可读的洞察,词云为手动检查单个文档提供了可扩展的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。