[论文解读] The Myths of Our Time: Fake News
本文提出了一套机器学习流水线,通过在精选新闻数据集上训练的LSTM语言模型,生成虚假新闻文章作为媒体艺术形式,以模拟病毒式传播的误导性信息。该项目以在线博客www.newsby.ml的形式发布,展示了人工智能如何复刻真实虚假新闻在风格和情感模式上的特征,揭示其背后的社会恐惧与欲望,同时为未来虚假新闻检测研究贡献了一个带标签的数据集。
While the purpose of most fake news is misinformation and political propaganda, our team sees it as a new type of myth that is created by people in the age of internet identities and artificial intelligence. Seeking insights on the fear and desire hidden underneath these modified or generated stories, we use machine learning methods to generate fake articles and present them in the form of an online news blog. This paper aims to share the details of our pipeline and the techniques used for full generation of fake news, from dataset collection to presentation as a media art project on the internet.
研究动机与目标
- 探究人工智能与网络文化如何促成现代‘神话’的生成,其形式类似于虚假新闻。
- 开发一种可复现的机器学习流水线,用于生成合成虚假新闻文章。
- 将生成的文章以基于网络的媒体艺术项目形式呈现,以引发人们对虚假信息及其心理根源的反思。
- 为未来虚假新闻检测研究贡献一个带标签的生成虚假新闻数据集。
提出的方法
- 使用特定主题的搜索查询,从多样化来源收集了245,973篇新闻文章,总字数达196.95百万词。
- 通过NLP工具使用关键词主题标签(例如:'朝鲜'、'特朗普'、'虚假新闻')对数据集进行过滤,创建专门的主题子集。
- 在每个主题子集上使用两层架构(每层128个单元)的LSTM语言模型进行训练,并采用束搜索(beam search)进行文本生成。
- 使用训练好的模型生成文章节选,并通过最少的人工编辑提升连贯性与结构。
- 利用Machinebox Textbox NLP工具自动为文章分配真实感标签。
- 将生成内容部署在自建博客www.newsby.ml上,配备虚构记者人物设定及AI生成的肖像。
实验结果
研究问题
- RQ1如何利用机器学习模型生成在风格和情感基调上模仿现实世界虚假信息的虚假新闻文章?
- RQ2社会恐惧与欲望在塑造现代虚假新闻(作为数字神话的新形式)的内容与结构中扮演何种角色?
- RQ3AI生成的虚假新闻在多大程度上可逃避FakerFact等自动化可信度检测工具的识别?
- RQ4受控的、艺术化的生成流水线在理解病毒式虚假信息传播机制方面能发挥何种作用?
- RQ5在公开的艺术语境中,使用AI模拟并揭示虚假新闻运作机制的伦理影响是什么?
主要发现
- FakerFact将生成的虚假新闻文章分类为具有议程驱动或观点倾向性,表明其成功复刻了真实虚假信息的语气与意图。
- 该项目成功创建了一个功能完整、公开可访问的博客(www.newsby.ml),共托管了245,973篇生成的文章,涵盖三个主题类别。
- 使用主题特定的LSTM模型,实现了连贯且风格一致的文章生成,准确反映了政治敏感领域真实新闻的语言模式。
- 人工干预极少——仅限于修复重复词语或断裂句子——证明了生成输出的稳健性。
- AI生成的记者身份(Misun Lean)及肖像(通过PGGAN生成)显著增强了项目的现实感与艺术表现力。
- 该项目已将带标签的数据集贡献至GitHub,供未来虚假新闻检测与生成研究使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。