Skip to main content
QUICK REVIEW

[论文解读] Comparing approaches for mitigating intergroup variability in personality recognition

Guozhen An, Rivka Levitan|arXiv (Cornell University)|Jan 31, 2018
Personality Traits and Psychology参考文献 26被引用 3
一句话总结

本文评估了两种方法——均质化(按性别和L1分组分别训练模型)与归一化(特征层面调整)——以减少语音自动人格识别中的组间差异。均质化方法显著优于归一化方法,尤其在同时按性别和L1分组时,对如责任心和开放性等特质的准确率提升最高达10个百分点。

ABSTRACT

Personality have been found to predict many life outcomes, and there have been huge interests on automatic personality recognition from a speaker's utterance. Previously, we achieved accuracies between 37%-44% for three-way classification of high, medium or low for each of the Big Five personality traits (Openness to Experience, Conscientiousness, Extraversion, Agreeableness, Neuroticism). We show here that we can improve performance on this task by accounting for heterogeneity of gender and L1 in our data, which has English speech from female and male native speakers of Chinese and Standard American English (SAE). We experiment with personalizing models by L1 and gender and normalizing features by speaker, L1 group, and/or gender.

研究动机与目标

  • 为解决语音自动人格识别中因性别和第一语言(L1)差异导致的组间差异问题。
  • 评估数据均质化与特征归一化哪种方法更能缓解由人口统计学和语言异质性引发的性能下降。
  • 确定为子群体(按性别和L1)分别训练模型是否能提升对五大性格特质分类的准确率,相较于统一模型。
  • 比较均质化与归一化在五个性格特质(开放性、责任心、外向性、宜人性、神经质)中的有效性。
  • 评估通过子群体特定建模是否能提升自我报告人格识别的性能——相比观察者评分预测,该任务更具挑战性。

提出的方法

  • 根据性别和L1(如男性SAE、女性MC)将训练数据划分为同质子集,为每个子群体分别训练模型。
  • 对说话人、性别和L1层级的特征进行归一化,以减少语音特征和语言使用上的差异。
  • 使用语音声学-语调特征和语言特征,在173对受试者组成的语料库中基于自我报告的五大性格得分训练模型。
  • 基于各特质在总体中的百分位数,采用三分类(高/中/低)任务,基线准确率约为33%。
  • 使用五折交叉验证评估性能,并通过统计显著性检验比较同质化模型与归一化模型及基线模型的表现。
  • 报告结果使用准确率,显著性水平设定为95%置信区间。

实验结果

研究问题

  • RQ1与异质基线相比,将训练数据按性别和L1分组划分为同质子群是否能提升人格识别准确率?
  • RQ2通过说话人、性别或L1组对特征进行归一化,是否能提升性能,超过基线或同质化模型?
  • RQ3哪些人格特质最受益于均质化?是否存在异质模型表现更优的特质?
  • RQ4均质化带来的性能提升是否足以抵消每模型训练数据量减少的影响?
  • RQ5当同时将性别和L1作为分组维度时,均质化的性能增益是否依然成立?

主要发现

  • 在大多数人格特质上,同时按性别和L1进行均质化的方法显著优于归一化和基线模型,对女性SAE说话人中开放性的准确率提升最高达10个百分点。
  • 责任心特质的最佳同质化模型准确率达到44%,较基线提升7个百分点,且优于所有归一化方法。
  • 使用说话人层级特征的归一化方法在任何特质上均未超过随机水平,且在开放性和宜人性上甚至劣于基线。
  • 性别归一化模型仅在责任心上优于基线,而L1归一化模型仅在责任心上表现出微弱增益,对外向性和神经质无益处。
  • 同质化模型始终优于归一化模型,最佳同质化模型在所有特质(除宜人性外)的准确率均比每种归一化方法至少高出0.03。
  • 除宜人性和神经质外,同质化模型的平均性能高于归一化模型;对于开放性,性别归一化模型略劣于平均同质化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。