Skip to main content
QUICK REVIEW

[论文解读] Challenges and Opportunities in Information Manipulation Detection: An Examination of Wartime Russian Media

Chan Young Park, Julia Mendelsohn|arXiv (Cornell University)|May 24, 2022
Misinformation and Its Impacts被引用 14
一句话总结

本文介绍了 VoynaSlov 数据集,该数据集包含 3800 万条以上来自 Twitter 和 VKontakte 的俄语媒体帖子,时间覆盖 2022 年俄罗斯-乌克兰战争爆发前及期间,旨在研究诸如议程设置、框架构建和优先化等微妙的信息操纵策略。通过使用翻译成英文文本的 NLP 模型,研究揭示了不同平台和媒体机构特有的操纵模式,并暴露了当前 NLP 方法在实时危机中检测细微宣传手段方面的局限性。

ABSTRACT

NLP research on public opinion manipulation campaigns has primarily focused on detecting overt strategies such as fake news and disinformation. However, information manipulation in the ongoing Russia-Ukraine war exemplifies how governments and media also employ more nuanced strategies. We release a new dataset, VoynaSlov, containing 38M+ posts from Russian media outlets on Twitter and VKontakte, as well as public activity and responses, immediately preceding and during the 2022 Russia-Ukraine war. We apply standard and recently-developed NLP models on VoynaSlov to examine agenda setting, framing, and priming, several strategies underlying information manipulation, and reveal variation across media outlet control, social media platform, and time. Our examination of these media effects and extensive discussion of current approaches' limitations encourage further development of NLP models for understanding information manipulation in emerging crises, as well as other real-world and interdisciplinary tasks.

研究动机与目标

  • 为解决缺乏真实世界、大规模数据集来捕捉实时危机中由国家支持的信息操纵问题。
  • 探究在俄罗斯-乌克兰战争期间,细微的操纵策略(如议程设置、框架构建和优先化)如何在不同媒体机构和平台间部署。
  • 评估现有 NLP 模型在检测细微、非虚假新闻形式的媒体操纵方面的性能与局限性。
  • 为未来在新兴冲突和跨学科语境下检测和减轻信息操纵的 NLP 研究提供基础。

提出的方法

  • 从 2021 年 1 月起,收集了 43 家俄语媒体机构(其中 23 家为国家关联媒体,20 家为独立媒体)在 Twitter 和 VKontakte 上的社交媒体帖子。
  • 使用 Facebook 的 WMT-ru-en 模型将所有俄语内容翻译成英文,以支持跨语言分析。
  • 应用在 MFC(媒体框架语料库)上微调过的 XLM-RoBERTa 模型,对帖子和评论中的句子进行框架标签分配。
  • 通过多数投票法(随机破除平局)聚合句子级别的框架标签,生成帖子和评论级别的框架标签。
  • 对 103 条俄语句子(来自 49 个帖子)进行人工标注,以评估模型性能和翻译质量,使用母语俄语者,并评估框架和翻译的可靠性。
  • 分析媒体机构类型(国家关联 vs. 独立)、平台(VK 与 Twitter)以及时间(战前 vs. 战时)之间操纵策略的差异。

实验结果

研究问题

  • RQ1在 2022 年战争期间,议程设置、框架构建和优先化策略在国家关联与独立俄语媒体机构之间有何不同?
  • RQ2在俄语战时媒体语境下,VKontakte 和 Twitter 平台的操纵模式有何差异?
  • RQ3当前 NLP 模型在检测多语言、实时危机数据中细微的框架构建策略方面的表现如何?
  • RQ4机器翻译输出在多大程度上保留了原始的框架意图?这对下游 NLP 分析有何影响?
  • RQ5现有 NLP 模型在检测新兴危机中细微、非虚假新闻形式的信息操纵方面存在哪些关键局限性?

主要发现

  • VoynaSlov 数据集包含自 2021 年 1 月以来收集的超过 3800 万条来自俄罗斯媒体在 Twitter 和 VKontakte 上的帖子,涵盖战前和战时时期。
  • NLP 模型在 '健康与安全' 框架上的宏平均 F1 得分为 62.9%,在 '犯罪与惩罚' 框架上为 60.0%,但在抽象框架(如 '能力与资源' 和 '合法性、合宪性、管辖权')上表现极差(F1 为 0%)。
  • 翻译质量较高,99% 的翻译被评为 '良好' 或 '可接受',表明英文翻译在框架分析中总体上是可靠的。
  • 在国家关联媒体与独立媒体之间,以及在不同平台之间,特别是在战时与战前时期,观察到显著的框架构建和议程设置策略差异。
  • 本研究揭示,当前 NLP 模型在处理抽象和复杂框架类别时存在困难,凸显了在检测超越明显虚假信息的复杂操纵方面仍存在关键差距。
  • 尽管翻译质量高且在具体框架上表现良好,但整体模型性能仍有限,尤其是在细微、依赖上下文的框架上,这凸显了在危机检测中需要具备上下文感知能力和可解释性的 NLP 模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。