[论文解读] Be In The Know: Connecting News Articles to Relevant Twitter Conversations
本文提出了一种机器学习框架,通过哈希标签自动将主流新闻文章与相关Twitter讨论连接起来,利用文章文本和推文线程的特征对哈希标签的相关性进行分类和排序。该系统在识别有意义的哈希标签方面实现了高精度,使记者能够实时追踪公众情绪和突发新闻。
In the era of data-driven journalism, data analytics can deliver tools to support journalists in connecting to new and developing news stories, e.g., as echoed in micro-blogs such as Twitter, the new citizen-driven media. In this paper, we propose a framework for tracking and automatically connecting news articles to Twitter conversations as captured by Twitter hashtags. For example, such a system could alert journalists about news that get a lot of Twitter reaction, so that they can investigate those conversations for new developments in the story, promote their article to a set of interested consumers, or discover general sentiment towards the story. Mapping articles to appropriate hashtags is nevertheless very challenging, due to different language styles used in articles versus tweets, the streaming aspect of news and tweets, as well as the user behavior when marking certain tweet-terms as hashtags. As a case-study, we continuously track the RSS feeds of Irish Times news articles and a focused Twitter stream over a two months period, and present a system that assigns hashtags to each article, based on its Twitter echo. We propose a machine learning approach for classifying and ranking article-hashtag pairs. Our empirical study shows that our system delivers high precision for this task.
研究动机与目标
- 解决主流新闻文章与相关Twitter讨论之间链接的挑战,特别是考虑到语言风格差异和实时流数据的特性。
- 开发一种系统,自动将新闻文章映射到合适的哈希标签,以反映公众对当前事件的情绪和讨论。
- 通过哈希标签追踪实现实时警报,提升记者工作流程,以监测热门话题和公众反应。
- 将哈希标签相关性建模为一个学习问题,使用从文章内容和相关推文提取的特征。
- 评估系统在识别有意义哈希标签方面的精确度,特别是在政治公投或危机等高风险新闻情境下。
提出的方法
- 该框架持续跟踪新闻文章的RSS源和聚焦的Twitter流,通过从文章标题和内容中动态提取关键词来实现。
- 通过预处理管道(包括哈希标签标准化和过滤)从与每篇文章相关的推文中提取候选哈希标签。
- 每个文章-哈希标签对使用四个关键特征:词汇重叠、推文频率、共现模式以及通过嵌入模型计算的语义相似度。
- 使用监督机器学习分类器(默认阈值为0.5)根据相关性对文章-哈希标签对进行排序,训练数据为人工标注的样本。
- 系统采用动态关键词集来播种并维持Twitter流的相关性,适应不断演变的新闻主题。
- 评估使用了爱尔兰时报两月期的新闻文章及其对应Twitter对话数据集,并通过人工标注确定真实标签。
实验结果
研究问题
- RQ1如何利用哈希标签作为语义锚点,有效将新闻文章与相关Twitter讨论连接?
- RQ2在考虑语言差异和用户行为差异的情况下,哪些特征最能预测某个哈希标签与给定新闻文章的相关性?
- RQ3机器学习模型在分类和排序文章-哈希标签对方面,能在多大程度上实现高精度?
- RQ4该系统在不同新闻类别(如政治、体育和危机)中的表现如何?
- RQ5该框架能否支持记者实现实时跟踪与警报,以监测公众情绪和突发新闻?
主要发现
- 该系统在识别相关哈希标签方面实现了高精度,例如在一篇关于科技活动的新闻文章中,对哈希标签#websummit的分类得分达到0.92。
- 对于与爱尔兰参议院公投相关的#seanad哈希标签,模型成功将多个相关文章排在0.82以上的得分位置,展示了有效的主题聚类能力。
- 该模型成功过滤了不相关的哈希标签,如#tobaccodirective和#mentalhealth,这些标签与文章主题无关。
- 在关于参议院公投最相关的一篇文章上,分类器得分高达0.99,表明在高影响力新闻事件中表现强劲。
- 该框架在嵌入空间中有效按哈希标签对新闻文章进行聚类,即使标题中没有共享关键词,也能将相关故事分组。
- 该方法在媒体监控、情绪追踪和事件检测等应用中展现出潜力,尤其适用于快速变化的新闻环境。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。