Skip to main content
QUICK REVIEW

[論文レビュー] Are 140 Characters Enough? A Large-Scale Linkability Study of Tweets

Mishari Al Mishari, Dali Kaafar|arXiv (Cornell University)|Jun 11, 2014
Authorship Attribution and Profiling参考文献 18被引用数 4
ひとこと要約

この論文は、8,000人以上のユーザーを含む大規模なデータセットを用いて、複数のアカウントに跨るTwitterユーザーのリンク可能性をスタイロメトリック分析により調査している。140文字制限の下でも、unigramおよびハッシュタグ特徴量にナイーブベイズ分類器を適用することで、同じ著者のツイートを90%以上の正確さでリンク可能であることが示された。これは、仮名アカウント利用者にとって顕著なプライバシー上の懸念を示している。

ABSTRACT

Microblogging is a very popular Internet activity that informs and entertains great multitudes of people world-wide via quickly and scalably disseminated terse messages containing all kinds of newsworthy utterances. Even though microblogging is neither designed nor meant to emphasize privacy, numerous contributors hide behind pseudonyms and compartmentalize their different incarnations via multiple accounts within the same, or across multiple, site(s). Prior work has shown that stylometric analysis is a very powerful tool capable of linking product or service reviews and blogs that are produced by the same author when the number of authors is large. In this paper, we explore linkability of tweets. Our results, based on a very large corpus of tweets, clearly demonstrate that, at least for relatively active tweeters, linkability of tweets by the same author is easily attained even when the number of tweeters is large. We also show that our linkability results hold for a set of actual Twitter users who tweet from multiple accounts. This has some obvious privacy implications, both positive and negative.

研究の動機と目的

  • 140文字制限下でのスタイロメトリック特徴量を用いて、複数アカウントに跨る同一著者のツイートをリンク可能かどうかを評価すること。
  • 特にunigramとハッシュタグといったシンプルな特徴量が、140文字制限下でどの程度有効であるかを評価すること。
  • 実際の二重アカウントを持つユーザーを対象にリンク可能性を検証し、実用的なプライバシー上のリスクを示すこと。
  • 大規模かつ現実世界のTwitterデータセットにおけるリンク可能性モデルのスケーラビリティと正確性を調査すること。
  • 複数の仮名アカウントを維持するユーザーが直面するプライバシーのトレードオフに関する知見を提供すること。

提案手法

  • トークンの条件付き独立性を仮定し、スタイロメトリック特徴量に基づいて著者識別を予測するため、ナイーブベイズ分類器を採用した。
  • 著者固有の書きぶりをモデル化するため、unigramの単語頻度とハッシュタグ頻度を主な特徴量とした。
  • ベイズの定理を用いて、特定のユーザーに属するツイートである事後確率を計算し、データセット内すべてのユーザーに対して最大化した。
  • 精度、再現率、F1スコアを用いて、プロフィールの多いツイートラー(2,000件以上)と比較的活動が少ないユーザー(300〜400件)の2つの大規模データセットでリンク可能性のパフォーマンスを評価した。
  • 実際のユーザーが複数のTwitterアカウントを運営しているケースに拡張し、同じ分類器フレームワークを用いてアカウント間でのリンク可能性をテストした。
  • 大規模なデータ収集のため、Twitter APIを用いてグローバルなツイートスナップショットを収集し、現実世界の関連性を確保した。

実験結果

リサーチクエスチョン

  • RQ1140文字制限下でも、スタイロメトリック特徴量のみを用いて、同一著者のツイートを信頼性高くリンク可能か?
  • RQ2ハッシュタグは、標準的なunigramと比較して、著者リンク可能性をどの程度向上させるか?
  • RQ3著者数が数万にまで増加した場合、リンク可能性パフォーマンスは低下するか?
  • RQ4提案手法は、複数のTwitterアカウントを運営する実際のユーザーのツイートを正しくリンクできるか?
  • RQ5メッセージ長さとツイート量は、スタイロメトリックモデルを用いた著者識別精度にどのような影響を及ぼすか?

主な発見

  • ナイーブベイズ分類器は、文字と単語のunigram頻度のみを用いて、同一著者のツイートを90%を超える正確さでリンク可能であった。
  • ハッシュタグを唯一の特徴量として使用した場合、分類器は約2/3のリンク可能性比を達成し、強力な識別能力を示した。
  • 実際に2つ以上のTwitterアカウントを運営する14名の実ユーザーについても、ツイートが正常にリンクされた。これは、本手法が実世界の二重アカウントシナリオに適用可能であることを裏付けた。
  • 著者数が非常に多くてもリンク可能性は高い水準を維持した。これは、現実世界の状況においても本アプローチのスケーラビリティが確認されたことを示している。
  • 本研究は、文字数制限が厳しい状況下でも、スタイロメトリック分析がマイクロブログ環境における著者リンクに著しく効果的であることを確認した。
  • 結果から、ハッシュタグのような最小限のテキスト特徴量ですら、リンク可能性を顕著に向上させられること、仮名ユーザーにとって非軽微なプライバシーリスクをもたらす可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。