[论文解读] Embedded HuffPost New Category Dataset
本文介绍了一个大规模、高质量的新闻类别数据集,包含2012年至2022年期间来自HuffPost的210,294篇新闻标题,附带细粒度的类别标签、发布日期和元数据。该数据集支持自然语言处理研究,涵盖语义标记、反讽检测和偏见分析,并已被广泛用于基于BERT模型的流行病学文本分类和媒体语言分析等任务。
People rely on news to know what is happening around the world and inform their daily lives. In today's world, when the proliferation of fake news is rampant, having a large-scale and high-quality source of authentic news articles with the published category information is valuable to learning authentic news' Natural Language syntax and semantics. As part of this work, we present a News Category Dataset that contains around 210k news headlines from the year 2012 to 2022 obtained from HuffPost, along with useful metadata to enable various NLP tasks. In this paper, we also produce some novel insights from the dataset and describe various existing and potential applications of our dataset.
研究动机与目标
- 创建一个大规模、高质量的新闻数据集,包含细粒度类别标签和元数据,以支持自然语言处理研究。
- 实现对新闻业趋势及媒体关注焦点随时间演变的分析。
- 支持语义标记、命名实体识别和词义消歧等自然语言处理任务。
- 为研究不同新闻类别间语言模式与语义结构提供基准。
- 促进媒体偏见研究,包括警察执法致死事件报道中的性别代表性与语言使用。
提出的方法
- 使用BeautifulSoup和Selenium进行网页爬取,从HuffPost的归档网页中收集新闻标题。
- 提取结构化元数据,包括类别、标题、作者、发布日期、简短描述和文章链接。
- 过滤掉文章数量少于1,000篇的类别,以确保数据质量和一致性。
- 通过结合真实新闻与TheOnion的反讽标题,采用融合注意力机制的神经网络模型进行反讽检测。
- 应用基于BERT的模型,识别与犯罪相关新闻中的媒体语言模式,特别是被动语态和名词化结构。
- 将过滤后的非流行病学新闻内容与疾病相关的内容进行垂直整合,构建用于流行病学文本分类的数据集。
实验结果
研究问题
- RQ1不同新闻类别之间的语言特征(如词汇选择和句法结构)有何差异?
- RQ2新闻类别元数据在反讽检测和语义标记等自然语言处理任务中,能在多大程度上提升模型性能?
- RQ3从2012年到2022年,新闻报道的关注焦点在各类别中如何演变?
- RQ4媒体在报道警察执法致死事件时,使用了哪些语言结构来模糊责任归属?
- RQ5隐性与显性的性别偏见在不同类别的新闻标题和摘要中如何体现?
主要发现
- 该数据集包含42个类别的210,294篇新闻标题,其中Politics(35,602篇)和Wellness(17,945篇)为最常见类别。
- 为确保数据质量,剔除了文章数量少于1,000篇的类别,从而形成聚焦于高覆盖率主题的精选数据集。
- 通过将本数据集与TheOnion整合构建的新闻标题反讽数据集,相比基于Twitter的反讽数据集,表现出更低的标签噪声和更高的标签密度。
- 基于BERT的分析显示,媒体对警察执法致死事件的报道中,被动语态、名词化和不及物动词的使用频率高于对平民遇害事件的报道,可能造成责任模糊化。
- 性别代表性分析揭示了在词汇选择、内容和标签方面,各类别新闻中普遍存在社会建构的偏见。
- 通过筛选疾病相关内容并将其与相关新闻整合,该数据集已被用于构建高质量的流行病学文本分类数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。