Skip to main content
QUICK REVIEW

[论文解读] Distant Supervision for Topic Classification of Tweets in Curated Streams

Salman Mohammed, Nimesh Ghelani|arXiv (Cornell University)|Apr 22, 2017
Misinformation and Its Impacts参考文献 5被引用 5
一句话总结

本文提出了一种新颖的远程监督方法,利用主题聚焦、人工筛选的Twitter信息流,自动为训练有效的推文主题分类器生成噪声较大的主题标签。通过在这些标签上训练逻辑回归模型,并对近期训练样本进行加权,该方法实现了高性能的分类效果——表现出更高的F1分数并能动态适应主题漂移,几乎无需人工标注即可实现。

ABSTRACT

We tackle the challenge of topic classification of tweets in the context of analyzing a large collection of curated streams by news outlets and other organizations to deliver relevant content to users. Our approach is novel in applying distant supervision based on semi-automatically identifying curated streams that are topically focused (for example, on politics, entertainment, or sports). These streams provide a source of labeled data to train topic classifiers that can then be applied to categorize tweets from more topically-diffuse streams. Experiments on both noisy labels and human ground-truth judgments demonstrate that our approach yields good topic classifiers essentially "for free", and that topic classifiers trained in this manner are able to dynamically adjust for topic drift as news on Twitter evolves.

研究动机与目标

  • 解决在嘈杂、主题分散的Twitter信息流中进行实时内容分发的主题分类挑战。
  • 通过利用现有的、人工筛选的、主题聚焦的Twitter账号作为弱监督来源,减少对昂贵的人工标注的依赖。
  • 开发一种能够动态适应不断演变的社交媒体内容中主题漂移的方法。
  • 评估在不断增加的远程监督数据量以及不同时间新旧程度的数据上进行训练的有效性。
  • 通过基于时间的新近度加权训练样本,提升分类器性能。

提出的方法

  • 该方法通过远程监督识别主题聚焦的Twitter账号(如@cnn、@ESPN)作为弱标签训练数据的来源。
  • 通过从这些人工筛选的信息流中收集推文,根据信息流的编辑焦点为其分配主题标签,构建训练数据集。
  • 在这些自动标注的推文上训练逻辑回归分类器,以对更广泛、主题分散的信息流中的内容进行分类。
  • 采用指数衰减函数对训练样本进行时间加权,使近期推文获得更高权重(参数设置为p=10)。
  • 在从信息流焦点推导出的噪声标签和人工标注的真实标签上对模型进行评估,以验证性能。
  • 将训练数据按时间顺序分割,以评估数据新近度和数据量对分类性能的影响。

实验结果

研究问题

  • RQ1利用人工筛选、主题聚焦的Twitter信息流进行远程监督,能否有效生成用于推文主题分类的训练标签?
  • RQ2远程监督数据量的增加如何影响主题分类器的性能?
  • RQ3在存在主题漂移的情况下,使用更近期的数据训练在多大程度上能提升分类性能?
  • RQ4对近期训练样本进行加权是否能带来可测量的F1分数提升?
  • RQ5在噪声标签上的结果与在人工标注真实标签上的结果相比如何?

主要发现

  • 随着来自远程监督的训练数据集规模增大,分类器性能显著提升,表现为F1、精确率和召回率的持续上升。
  • 使用更近期的数据进行训练能持续提升F1分数,表明当使用过时数据时,主题漂移会负面影响性能。
  • 使用p=10对近期训练样本进行加权,可带来显著的F1分数提升:在人工标注数据上,健康类+0.16,科学类+0.14,商业类+0.13。
  • 该方法在人工标注的真实标签上也表现出强劲性能,F1分数在各主题上最高提升0.16,证实了远程监督标签的有效性。
  • 该方法能有效适应主题漂移,如基于时间新近度的训练带来的持续收益所示,表明其适用于实时新闻分类。
  • 尽管资源稀少,该方法在低资源主题(如科学类)上仍能实现可测量的性能提升,使用加权训练使F1分数提升0.14。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。