Skip to main content
QUICK REVIEW

[論文レビュー] The Mafiascum Dataset: A Large Text Corpus for Deception Detection

Bob de Ruiter, George Kachergis|arXiv (Cornell University)|Nov 19, 2018
Deception detection and forensic psychology参考文献 18被引用数 8
ひとこと要約

本稿では、700以上のオンラインマフィアゲームから得た9,000件を超えるフォーラムベースのテキスト文書から構成される大規模で公開可能なコロナス「Mafiascum」を紹介する。プレイヤーはランダムに偽善的または非偽善的役割に割り当てられる。手作業で選別した言語的特徴とFastText単語埋め込みを用いて、ロジスティック回帰モデルが長文(5,000語以上)においてAUC-ROC 0.68、平均適合率0.39を達成し、運任せの水準を著しく上回った。これは、本データセットが欺瞞検出研究に有用であることを示している。

ABSTRACT

Detecting deception in natural language has a wide variety of applications, but because of its hidden nature there are currently no public, large-scale sources of labeled deceptive text. This work introduces the Mafiascum dataset [1], a collection of over 700 games of Mafia, in which players are randomly assigned either deceptive or non-deceptive roles and then interact via forum postings. Over 9000 documents were compiled from the dataset, which each contained all messages written by a single player in a single game. This corpus was used to construct a set of hand-picked linguistic features based on prior deception research, as well as a set of average word vectors enriched with subword information. A logistic regression classifier fit on a combination of these feature sets achieved an average precision of 0.39 (chance = 0.26) and an AUROC of 0.68 on 5000+ word documents. On 50+ word documents, an average precision of 0.29 (chance = 0.23) and an AUROC of 0.59 was achieved. [1] https://bitbucket.org/bopjesvla/thesis/src

研究の動機と目的

  • 自然言語における欺瞞検出のための、大規模で公開可能でラベルが付与されたデータセットが不足しているという問題に取り組むこと。
  • マフィアゲームの役割割り当てにより、自然に発生する欺瞞と体系的にラベル付けされた、現実的でインタラクティブな環境を構築すること。
  • 従来の言語的兆候と分散型単語表現が、多様で長文の対話的テキストにおいて欺瞞を検出するのにどの程度有効であるかを評価すること。
  • 欺瞞の文脈や通信モダリティをまたがる一般化研究を支援するベンチマークデータセットを提供すること。
  • 再現可能で大規模かつ倫理的に収集されたデータセットを公開することで、欺瞞研究におけるオープンサイエンスを促進すること。

提案手法

  • Mafiascumデータセットは、フォーラムで開催された700件以上のオンラインマフィアゲームから構築された。プレイヤーは偽善的(マフィア)または真実的(町民)な役割にランダムに割り当てられた。
  • 各ドキュメントは、1つのゲーム内で1人のプレイヤーが投稿した全メッセージから構成され、合計9,000件以上のドキュメントが得られ、平均長は3,940語であった。
  • 先行するメタアナリシスの結果(Hauch et al., 2015)に基づいて、14種類の手作業で選別された言語的特徴が抽出された。これには、代名詞の比率、否定の使用、文の長さ、感覚的言語が含まれる。
  • サブワード情報が組み込まれたFastText単語埋め込みがテキスト表現に用いられ、語彙的および意味的パターンを捉えた。
  • ロジスティック回帰分類器は、言語的特徴と単語埋め込みの組み合わせを学習対象とし、ドキュメント長のセグメントごとにAUC-ROCと平均適合率で性能を評価した。
  • 交差検証が適用され、プレイヤーの入れ替えがあったゲームからのドキュメントを除外することで、潜在的な交絡要因の影響を評価するための妥当性テストが実施された。

実験結果

リサーチクエスチョン

  • RQ1インタラクティブなオンラインゲームから、自然に発生する偽善的および真実のテキストを含む大規模で公開可能なデータセットを構築できるか?
  • RQ2既知の欺瞞に関する言語的兆候は、制御されたゲーム環境における長文でインタラクティブで役割ベースの対話に一般化可能か?
  • RQ3サブワード情報を含む単語埋め込みは、手作業で選別した言語的特徴と比較して、欺瞞検出においてどの程度の性能を示すか?
  • RQ4文の頻度や長さなどの文脈的・通信固有の特徴は、この文脈で欺瞞をどの程度正確に予測できるか?
  • RQ5言語的特徴と埋め込み特徴の組み合わせに基づく線形モデルは、多様なドキュメント長にわたって、運任せの水準を著しく上回る性能を達成できるか?

主な発見

  • 手作業で選別した言語的特徴とFastText埋め込みの組み合わせで学習したロジスティック回帰モデルは、5,000語以上のドキュメントにおいてAUC-ROC 0.68、平均適合率0.39を達成し、運任せの水準(0.26)を著しく上回った。
  • 短いドキュメント(50語以上)においても、AUC-ROC 0.59、平均適合率0.29を達成し、運任せの水準(0.23)を上回った。これは、短いテキストにおいても検出可能な信号が存在することを示している。
  • メタアナリシスで有意であった6つの言語的特徴のうち、期待される効果の方向と一致したのは2つ(文の長さと三人称代名詞比率)にとどまり、言語的兆候の効果が文脈依存的である可能性を示唆した。
  • 偽善的プレイヤーは、真実的プレイヤーと比較して、より長い個々のメッセージを投稿したが、投稿頻度は低かった。これは、戦略的な自己監視や注意の回避の可能性を示している。
  • プレイヤーの入れ替えがあったゲームからのドキュメントを除外しても、モデルの性能は安定しており、データセットがわずかな交絡要因に対して頑健であることを裏付けた。
  • 本研究は、孤立した言語的特徴に基づく線形モデルの限界を浮き彫りにした。欺瞞の文脈をまたがる一般化を実現するには、文脈と語の相互作用を捉えるモデルが必要である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。