Skip to main content
QUICK REVIEW

[论文解读] The Mafiascum Dataset: A Large Text Corpus for Deception Detection

Bob de Ruiter, George Kachergis|arXiv (Cornell University)|Nov 19, 2018
Deception detection and forensic psychology参考文献 18被引用 8
一句话总结

本文介绍了 Mafiascum 数据集,这是一个大规模、公开可用的语料库,包含来自 700 多个在线 Mafia 游戏的超过 9,000 篇基于论坛的文本文档,其中玩家被随机分配至具有欺骗性或非欺骗性的角色。利用手工设计的语言特征和 FastText 词嵌入,逻辑回归模型在长文档(5,000+ 字符)上的 AUROC 达到 0.68,平均精度达到 0.39,显著优于随机水平,证明了该数据集在欺骗检测研究中的实用性。

ABSTRACT

Detecting deception in natural language has a wide variety of applications, but because of its hidden nature there are currently no public, large-scale sources of labeled deceptive text. This work introduces the Mafiascum dataset [1], a collection of over 700 games of Mafia, in which players are randomly assigned either deceptive or non-deceptive roles and then interact via forum postings. Over 9000 documents were compiled from the dataset, which each contained all messages written by a single player in a single game. This corpus was used to construct a set of hand-picked linguistic features based on prior deception research, as well as a set of average word vectors enriched with subword information. A logistic regression classifier fit on a combination of these feature sets achieved an average precision of 0.39 (chance = 0.26) and an AUROC of 0.68 on 5000+ word documents. On 50+ word documents, an average precision of 0.29 (chance = 0.23) and an AUROC of 0.59 was achieved. [1] https://bitbucket.org/bopjesvla/thesis/src

研究动机与目标

  • 为自然语言中的欺骗检测填补缺乏大规模、公开可用、已标注数据集的空白。
  • 创建一个真实、互动的环境,使欺骗行为自然发生,并通过在线 Mafia 游戏中的角色分配实现系统性标注。
  • 评估传统语言线索与分布式词表示在多样、长篇对话文本中检测欺骗的有效性。
  • 提供一个基准数据集,支持在不同欺骗情境和沟通模式之间进行泛化研究。
  • 通过发布可复现、大规模且合乎伦理收集的数据集,推动欺骗研究的开放科学。

提出的方法

  • Mafiascum 数据集源自在论坛上举办的 700 多个在线 Mafia 游戏,玩家被随机分配至欺骗性(Mafia)或非欺骗性(平民)角色。
  • 每篇文档由单个玩家在单场游戏中发布的全部消息组成,共生成超过 9,000 篇文档,平均长度为 3,940 个词。
  • 基于先前元分析研究结果(Hauch 等,2015),提取了 14 项精心挑选的语言特征,包括代词比例、否定词使用、句子长度和感官语言等。
  • 使用包含子词信息的 FastText 词嵌入表示文本,以捕捉形态和语义模式。
  • 在语言特征与词嵌入的组合基础上训练逻辑回归分类器,并通过在不同文档长度区间内的 AUROC 和平均精度评估性能。
  • 应用交叉验证,并通过排除存在玩家替换的游戏中的文档来测试稳健性,以评估潜在混杂因素的影响。

实验结果

研究问题

  • RQ1能否从互动性在线游戏中构建一个大规模、公开可用的、自然发生的欺骗性与真实性文本语料库?
  • RQ2已确立的欺骗语言线索是否能推广到受控游戏环境中长篇、互动、基于角色的对话中?
  • RQ3与手工设计的语言特征相比,包含子词信息的词嵌入在欺骗检测中的表现如何?
  • RQ4在本情境中,上下文和沟通特异性特征(如消息频率和长度)在多大程度上能预测欺骗行为?
  • RQ5在结合语言特征与嵌入特征的基础上,线性模型是否能在不同长度的文档中实现显著高于随机水平的欺骗检测性能?

主要发现

  • 在 5,000+ 个词的文档上,基于手工挑选的语言特征与 FastText 嵌入组合训练的逻辑回归模型,AUROC 达到 0.68,平均精度达到 0.39,显著优于 0.26 的随机水平。
  • 在较短文档(50+ 个词)上,模型的 AUROC 为 0.59,平均精度为 0.29,仍高于 0.23 的随机水平,表明即使在简短文本中也存在可检测的信号。
  • 元分析中六个显著的语言特征仅有两项(句子长度和第三人称代词比例)与预期效应方向一致,表明语言线索具有情境依赖性。
  • 欺骗性玩家发布的单条消息更长,但频率低于真实玩家,表明存在策略性自我监控和潜在的注意力规避。
  • 即使在排除存在玩家替换的游戏文档后,模型性能仍保持稳定,支持该数据集对微小混杂因素的鲁棒性。
  • 本研究强调了基于孤立语言特征的线性模型的局限性,表明要实现在不同欺骗情境间的泛化,可能需要能够捕捉上下文-词语交互的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。