[论文解读] An Exploration of Unreliable News Classification in Brazil and The U.S
本研究通过写作风格和语言复杂度特征,调查了巴西和美国不可靠新闻的分类问题,表明一组少量的通用特征——尤其是与简洁性、句子长度和标点符号相关的特征——可在葡萄牙语和英语数据集上以70%的准确率区分可靠与不可靠信息源,证明了风格特征在跨语言和跨文化情境下对虚假信息检测具有普适性。
The propagation of unreliable information is on the rise in many places around the world. This expansion is facilitated by the rapid spread of information and anonymity granted by the Internet. The spread of unreliable information is a wellstudied issue and it is associated with negative social impacts. In a previous work, we have identified significant differences in the structure of news articles from reliable and unreliable sources in the US media. Our goal in this work was to explore such differences in the Brazilian media. We found significant features in two data sets: one with Brazilian news in Portuguese and another one with US news in English. Our results show that features related to the writing style were prominent in both data sets and, despite the language difference, some features have a universal behavior, being significant to both US and Brazilian news articles. Finally, we combined both data sets and used the universal features to build a machine learning classifier to predict the source type of a news article as reliable or unreliable.
研究动机与目标
- 调查写作风格特征是否能够区分巴西(葡萄牙语)和美国(英语)媒体中的可靠、不可靠及讽刺性新闻来源。
- 评估识别不可靠新闻的特征在不同语言、文化及政治背景下的普遍性程度。
- 利用两个数据集的共享特征构建统一的机器学习分类器,以预测跨国家和语言的来源可靠性。
- 评估基于内容的特征在英语之外及单一国家情境之外的泛化潜力。
提出的方法
- 收集并分析了两组数据集:一组为巴西新闻的葡萄牙语文本,另一组为美国新闻的英语文本,重点关注可靠、不可靠及讽刺性来源。
- 提取了188项语言和风格特征,涵盖三类:文本复杂度(如词长、句长)、风格特征(如标点符号、大写字母使用)以及词性模式。
- 通过统计显著性检验,识别出在每组数据集中可靠、不可靠及讽刺性来源之间存在显著差异的特征。
- 应用Kendall等级相关系数,衡量美国与巴西数据集在特征排序上的一致性,识别出具有稳定方向趋势的特征。
- 使用在两个数据集中均显著的特征交集,训练机器学习分类器,以在合并数据集上预测来源类型。
- 通过测试准确率评估模型性能,随机猜测的基线准确率为50%。
实验结果
研究问题
- RQ1仅凭写作风格是否能够区分美国和巴西媒体中的可靠、不可靠及讽刺性新闻来源?
- RQ2是否存在两国共有的显著语言特征,并表现出一致的方向性趋势,表明其普遍性?
- RQ3在一种语言和文化中训练的单一特征集,在另一语言和文化中对新闻可靠性分类的泛化能力如何?
- RQ4在跨语言和跨文化背景下,风格特征与复杂度特征在区分来源类型方面的能力有何差异?
主要发现
- 在巴西数据集中,使用60个显著特征对可靠与不可靠新闻进行分类,测试准确率达到85%,显著高于50%的基线。
- 在美国数据集中,使用49个显著特征,测试准确率达到72%,再次超过基线,证实了语言特征的预测能力。
- 使用仅18个两国共有的特征构建的联合分类器,准确率达到70%,证明了跨语言和文化通用特征的存在。
- 与文本复杂度相关的特征——如整体长度更短、句子更长、语言更简单——在两国不可靠来源中均表现得更为突出。
- 风格特征如问号、感叹号和全大写字母的使用频率更高,在不可靠来源中显著更常见,表明其采用吸引注意力的策略。
- 词性特征在两国之间的一致性较弱,表明复杂度和风格特征在分类中的普遍可靠性高于句法模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。