Skip to main content
QUICK REVIEW

[论文解读] 4chan & 8chan embeddings

Pierre Voué, Tom De Smedt|arXiv (Cornell University)|Apr 2, 2020
Molecular Junctions and Nanostructures被引用 6
一句话总结

本文提出了一种在 4chan 和 8chan 的 /pol/ 论坛上超过 3000 万条消息上训练的大规模词嵌入模型,捕捉了有毒和极端主义语言模式。最终生成的 0.4GB 词嵌入模型已公开发布,以支持仇恨言论检测和有毒话语分析的研究。

ABSTRACT

We have collected over 30M messages from the publicly available /pol/ message boards on 4chan and 8chan, and compiled them into a model of toxic language use. The trained word embeddings (0.4GB) are released for free and may be useful for further study on toxic discourse or to boost hate speech detection systems: https://textgain.com/8chan.

研究动机与目标

  • 创建一个大规模、公开可用的 NLP 资源,用于研究匿名图片论坛上的有毒和极端主义话语。
  • 对以高毒性与激进内容著称的 4chan 和 8chan /pol/ 论坛的语言模式进行建模。
  • 提供一个预训练的词嵌入模型,以增强下游仇恨言论检测系统。
  • 通过发布数据集和训练好的模型并保持完全透明,实现在线毒性研究的可复现性。

提出的方法

  • 作者通过公开 API 和网络爬取,从 4chan 和 8chan 的 /pol/ 论坛收集了超过 3000 万条消息。
  • 文本经过分词、转小写以及过滤处理,以去除非文本内容。
  • 使用带有负采样的 Skip-gram 模型训练词嵌入,这是词表示学习中的标准方法。
  • 模型在大规模、多样化的匿名、未经审核的在线话语语料上进行训练,以捕捉现实世界中的有毒语言模式。
  • 最终的词嵌入模型经过压缩,以 0.4GB 文件形式公开发布,供公众访问和重用。
  • 数据集和模型托管于 arXiv,并通过 DOI 链接,确保持久引用。

实验结果

研究问题

  • RQ1如何使用词嵌入有效建模匿名论坛中大规模的真实世界有毒话语?
  • RQ24chan 和 8chan 的 /pol/ 论坛中存在哪些语言模式,使其与主流在线话语区分开来?
  • RQ3在 /pol/ 内容上训练的预训练嵌入模型在多大程度上能提升仇恨言论检测系统?
  • RQ4公开发布的、大规模的有毒在线内容数据集能否支持 NLP 和计算社会科学中的可复现研究?

主要发现

  • 作者成功训练并发布了基于 4chan 和 8chan /pol/ 论坛 3000 万条消息的 0.4GB 词嵌入模型。
  • 该模型捕捉到了这些匿名论坛中典型的高频有毒和极端主义语言模式。
  • 数据集和模型可通过 arXiv 获取,并附带 DOI,确保长期可复现性和引用。
  • 该词嵌入模型设计为可直接用于下游 NLP 任务,特别是仇恨言论检测。
  • 该发布支持在线毒性领域的开放研究,为大规模研究激进化话语提供了资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。