Skip to main content
QUICK REVIEW

[論文レビュー] On the Stability of Online Language Features: How Much Text do you Need to know a Person?

Eben M. Haber|arXiv (Cornell University)|Apr 24, 2015
Authorship Attribution and Profiling参考文献 8被引用数 9
ひとこと要約

本研究は、Twitter、メール、ブログ、フォーラムなどの異なるプラットフォーム間でオンラインテキストから導出された言語的特徴の安定性を調査し、LIWC、Big5、基本的人間価値を用いた性格特徴の信頼性のある推定に必要な最小テキスト量を特定する。結果として、言語的特徴は個人あたり約1,000〜2,000語の時点で安定し、メディアによって顕著な差が見られることが判明。性格推定モデルにおけるメディア特化型のチューニングの必要性が強調される。

ABSTRACT

In recent years, numerous studies have inferred personality and other traits from people's online writing. While these studies are encouraging, more information is needed in order to use these techniques with confidence. How do linguistic features vary across different online media, and how much text is required to have a representative sample for a person? In this paper, we examine several large sets of online, user-generated text, drawn from Twitter, email, blogs, and online discussion forums. We examine and compare population-wide results for the linguistic measure LIWC, and the inferred traits of Big5 Personality and Basic Human Values. We also empirically measure the stability of these traits across different sized samples for each individual. Our results highlight the importance of tuning models to each online medium, and include guidelines for the minimum amount of text required for a representative result.

研究の動機と目的

  • LIWC、Big5性格、基本的人間価値を用いて測定された言語的特徴が、異なるオンラインテキストソース間でどの程度安定しているかを評価すること。
  • 個人ごとに性格特徴の代表的かつ安定した推定を得るための最小テキスト量を特定すること。
  • Twitter、メール、ブログ、フォーラムなどの多様なオンラインメディアにおける言語的特徴の変動を評価すること。
  • 特定のオンラインプラットフォームに適した性格推定モデルのチューニングのための実証的ガイドラインを提供すること。

提案手法

  • 本研究は、Twitter、メール、ブログ、ディスカッションフォーラムの4つのオンラインプラットフォームから大規模なユーザ生成テキストを収集した。
  • 言語的特徴は、語の頻度と意味的カテゴリーを分析するため、LIWC(Linguistic Inquiry and Word Count)ツールを用いて抽出した。
  • Big5性格および基本的人間価値の性格特徴は、LIWCの出力に基づく既存のモデルを用いて推定した。
  • 特性の安定性は、各個人の逐次的なより大きなテキストサンプル間で組み込み相関係数(ICC)を計算することで測定した。
  • テキストサイズ(100語から10,000語まで)とプラットフォームごとに、収束点を特定するために特性の安定性を比較分析した。
  • 統計的モデリングを用いて、ICC > 0.8 となる最小テキスト長を特定し、特性推定が安定する点を定義した。

実験結果

リサーチクエスチョン

  • RQ1Twitter、メール、ブログ、フォーラムなどの異なるプラットフォーム間で、オンラインテキストから導出された言語的特徴はどの程度安定しているか?
  • RQ2個人の性格特徴を安定的かつ代表的に推定するのに必要な最小テキスト量は何か?
  • RQ3LIWCベースの特徴の安定性特性は、オンラインメディアによってどのように異なるか?
  • RQ4テキストサンプルサイズが増加するにつれて、性格推定(Big5および基本的人間価値)はどの程度一貫性を保つのか?
  • RQ5普遍的に適用可能な1つのテキスト長の閾値を、すべてのオンラインプラットフォームに適用できるか?

主な発見

  • LIWCから導出された言語的特徴は、異なるオンラインプラットフォーム間で著しい安定性の差を示し、特にTwitterはメールやブログに比べて安定性が低いことが判明した。
  • Big5および基本的人間価値の性格特徴推定は、個人あたり約1,000〜2,000語の時点で安定し、この閾値でICC値が0.8を超える。
  • メールおよびブログのテキストでは安定性が一貫して高く、Twitterに比べて顕著に優れていることから、信頼性の高い推定にはプラットフォーム特化型のチューニングが不可欠である。
  • 安定した性格推定に必要な最小テキスト長はプラットフォームによって異なり、特に短い形式のメディアであるTwitterは、より長いテキストを必要とする。
  • 本研究は、大多数のオンラインメディアで安定的かつ代表的な性格プロファイルを得るための実用的閾値として、1,000〜2,000語を特定した。
  • 結果から、プラットフォーム全体に共通のテキスト長のカットオフを適用すると、特に短い形式のプラットフォーム(例:Twitter)では信頼性の低い性格推定が生じる可能性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。