Skip to main content
QUICK REVIEW

[论文解读] On the Stability of Online Language Features: How Much Text do you Need to know a Person?

Eben M. Haber|arXiv (Cornell University)|Apr 24, 2015
Authorship Attribution and Profiling参考文献 8被引用 9
一句话总结

本研究调查了从不同平台(Twitter、电子邮件、博客、论坛)获取的在线文本中提取的语言特征的稳定性,并确定了使用LIWC、Big5和基本人类价值观方法可靠推断人格特质所需的最小文本量。结果表明,语言特征在每人约1,000–2,000个单词时趋于稳定,且在不同媒体间存在显著差异,强调在人格推断模型中需针对不同媒体进行特定调优。

ABSTRACT

In recent years, numerous studies have inferred personality and other traits from people's online writing. While these studies are encouraging, more information is needed in order to use these techniques with confidence. How do linguistic features vary across different online media, and how much text is required to have a representative sample for a person? In this paper, we examine several large sets of online, user-generated text, drawn from Twitter, email, blogs, and online discussion forums. We examine and compare population-wide results for the linguistic measure LIWC, and the inferred traits of Big5 Personality and Basic Human Values. We also empirically measure the stability of these traits across different sized samples for each individual. Our results highlight the importance of tuning models to each online medium, and include guidelines for the minimum amount of text required for a representative result.

研究动机与目标

  • 评估通过LIWC、Big5人格和基本人类价值观测量的语言特征在不同在线文本来源中的稳定性。
  • 确定每位个体实现人格特质代表性且稳定估计所需的最小文本量。
  • 评估语言特征在Twitter、电子邮件、博客和论坛等多样化在线媒体中的变化情况。
  • 为针对特定在线平台调优人格推断模型提供实证指导。

提出的方法

  • 本研究从四个在线平台(Twitter、电子邮件、博客和讨论论坛)收集了大规模用户生成的文本。
  • 使用LIWC(语言探究与词频统计)工具提取语言特征,以分析词频和语义类别。
  • 基于LIWC输出结果,利用既定模型推断人格特质(Big5人格和基本人类价值观)。
  • 通过计算每位个体逐步增加的文本样本中的人格特质组内相关系数(ICC)来衡量特质的稳定性。
  • 分析比较了不同文本量(100至10,000个单词)和不同平台下的人格特质稳定性,以识别收敛点。
  • 采用统计建模方法,确定人格特质估计趋于稳定的最小文本长度,定义为ICC > 0.8。

实验结果

研究问题

  • RQ1从Twitter、电子邮件、博客和论坛等不同平台获取的在线文本中提取的语言特征有多稳定?
  • RQ2需要多少最少的文本量才能获得个体人格特质的稳定且具有代表性的估计?
  • RQ3基于LIWC的特征在不同在线媒体中的稳定性特征有何差异?
  • RQ4随着文本样本量的增加,人格推断(Big5和基本人类价值观)的一致性在多大程度上保持不变?
  • RQ5是否可以为所有在线平台统一应用单一的文本长度阈值以实现可靠的人格画像?

主要发现

  • 基于LIWC的语言特征在不同在线平台间表现出显著的稳定性差异,其中Twitter的稳定性低于电子邮件和博客。
  • 人格特质估计(Big5和基本人类价值观)在每人约1,000–2,000个单词时趋于稳定,此时ICC值超过0.8。
  • 电子邮件和博客文本的稳定性始终高于Twitter,表明在可靠推断中必须进行平台特定的调优。
  • 实现稳定人格推断所需的最小文本长度因平台而异,Twitter所需文本量多于长文本媒体才能获得可靠结果。
  • 本研究确定1,000–2,000个单词为在大多数在线媒体中实现稳定、具有代表性的个性画像的实用阈值。
  • 结果表明,若在所有平台上统一使用单一文本长度截止值,将导致不可靠的人格推断,尤其在Twitter等短文本平台中更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。