Skip to main content
QUICK REVIEW

[論文レビュー] Sockpuppet Detection in Wikipedia: A Corpus of Real-World Deceptive Writing for Linking Identities

Thamar Solorio, Ragib Hasan|arXiv (Cornell University)|Oct 24, 2013
Authorship Attribution and Profiling参考文献 7被引用数 15
ひとこと要約

本論文は、実際の管理者調査を自動的にクロールする半自動的手法により収集された、Wikipediaのソックプーリー事例からの実世界の偽りの文章を含む、最初の公開可能で利用可能なコーパスを紹介する。正規化されたペアワイズ特徴差分を用いたサポートベクターマシンを用いることで、著者同一性付与の分野において73%のF-measureを達成し、敵対的オンライン環境における自動著者識別に関するベンチマークを確立した。

ABSTRACT

This paper describes the corpus of sockpuppet cases we gathered from Wikipedia. A sockpuppet is an online user account created with a fake identity for the purpose of covering abusive behavior and/or subverting the editing regulation process. We used a semi-automated method for crawling and curating a dataset of real sockpuppet investigation cases. To the best of our knowledge, this is the first corpus available on real-world deceptive writing. We describe the process for crawling the data and some preliminary results that can be used as baseline for benchmarking research. The dataset will be released under a Creative Commons license from our project website: http://docsig.cis.uab.edu.

研究の動機と目的

  • 敵対的オンライン環境における偽りの文章の実世界データセットが不足しているという問題に取り組む。
  • 手動によるプライバシーを侵害するIPチェックに依存しない、自動化されたソックプーリー検出ツールの開発を目的とする。
  • SNSのコンテンツに類似した短い敵対的テキストにおける著者同一性付与のためのベンチマークデータセットを提供する。
  • 人工的または自己動機によるごまかしではなく、実世界の偽りの状況下でのスタイルメトリクス分析に関する研究を可能にする。
  • オンラインコミュニティ向けにスケーラブルでプライバシーを守る検出システムの開発を支援する。

提案手法

  • 公開されたトークページの議論から、623件のWikipediaソックプーリー調査(SPI)事例を半自動的ウェブクローリングおよびキュレーションする。
  • 話題ページのコンテンツがないケースを手動で除外し、305件の確認済みSPI事例と318件の非ソックプーリー事例を抽出した。
  • n-gram、文字レベルの統計、構文的特徴を含む、編集者間のコメントベクトルの正規化されたペアワイズ差分に基づく特徴工学。
  • 2人の編集者が同じ人物であるかどうかを判断するために、ペアワイズ編集者比較に基づいてサポートベクターマシン(SVM)分類器を訓練する。
  • 10分割交差検証を用いて性能を評価し、重要な特徴群を同定する。
  • 全特徴群を用いたベースラインモデルの評価の後、1つの特徴群を順次除外してアブレーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1Wikipediaのソックプーリー由来の実世界の偽りの文章を、信頼性を持って収集・キュレーションし、公開可能なデータセットとして構築できるか?
  • RQ2IPデータが利用できない状況でも、スタイルメトリクス特徴を用いた機械学習的手法が、ソックプーリー関係の検出にどの程度有効であるか?
  • RQ3どの特徴群がソックプーリー検出性能に最も寄与しているか?
  • RQ4このデータセットは、敵対的環境下での著者同一性付与の現実的で信頼できるベンチマークとして機能できるか?
  • RQ5実世界データにおける性能は、人工的または自己によるごまかしデータセットと比較してどの程度異なるか?

主な発見

  • 最終的なコーパスは623件の事例を含み、うち305件が確認済みのソックプーリー事例、318件が非ソックプーリー事例であり、1事例あたり平均180件のコメント、1編集者あたり平均83件のコメントが含まれる。
  • このデータセットは研究利用を目的として、クリエイティブ・コモンズ・ライセンスの下で公開されている。
  • 全特徴群を用いたサポートベクターマシン分類器は、73%のF-measureを達成し、今後の研究における強力なベースラインを提供している。
  • 個々の特徴群を除外することで性能が低下したため、各特徴群が検出精度に有意義に寄与していることが示された。
  • このコーパスは、著者が意図的に自分の身元を隠している短い敵対的テキストの最初の実世界データセットであり、SNSやセキュリティ分野の応用において極めて関連性が深い。
  • 結果から、IPアドレスへの管理者特権アクセスに依存せず、テキスト特徴のみで自動的なソックプーリー検出が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。