Skip to main content
QUICK REVIEW

[论文解读] Automatic Text-based Personality Recognition on Monologues and Multiparty Dialogues Using Attentive Networks and Contextual Embeddings

Hang Jiang, Xianzhe Zhang|arXiv (Cornell University)|Nov 21, 2019
Topic Modeling参考文献 6被引用 15
一句话总结

本文提出了一种新型基于对话的个性识别数据集 FriendsPersona,并提出了一种使用上下文嵌入(BERT 和 RoBERTa)的注意力神经网络框架,以提升自动个性识别性能。在 Essays 数据集上实现了平均准确率 2.49% 的提升,并在 FriendsPersona 上建立了强有力的基准,突显了在多人对话中建模个性的挑战。

ABSTRACT

Previous works related to automatic personality recognition focus on using traditional classification models with linguistic features. However, attentive neural networks with contextual embeddings, which have achieved huge success in text classification, are rarely explored for this task. In this project, we have two major contributions. First, we create the first dialogue-based personality dataset, FriendsPersona, by annotating 5 personality traits of speakers from Friends TV Show through crowdsourcing. Second, we present a novel approach to automatic personality recognition using pre-trained contextual embeddings (BERT and RoBERTa) and attentive neural networks. Our models largely improve the state-of-art results on the monologue Essays dataset by 2.49%, and establish a solid benchmark on our FriendsPersona. By comparing results in two datasets, we demonstrate the challenges of modeling personality in multi-party dialogue.

研究动机与目标

  • 解决自然语言处理中自动个性识别缺乏基于对话的数据集的问题。
  • 探索上下文嵌入(BERT 和 RoBERTa)以及注意力神经网络在个性识别任务中的有效性。
  • 通过一种新颖且可扩展的对话提取方法,在多人对话中建立个性识别的新基准。
  • 在独白与多人对话设置下比较模型性能,识别建模说话者互动的挑战。

提出的方法

  • 开发了一种新颖的对话提取算法 MainSpeakerFinder (MSF),通过分析每位说话者的话语数量滑动窗口,识别峰值并提取以主要说话者为中心的子场景。
  • 通过众包方式对《老友记》前四季的 711 个子场景进行标注,构建了 FriendsPersona 数据集,为五大人格特质提供二元标签。
  • 应用微调后的预训练上下文嵌入(BERT 和 RoBERTa)与注意力神经网络(ABCNN、ABLSTM、HAN)结合,以建模文本表征。
  • 通过三种输入格式评估模型:单人(仅目标说话者)、单人+上下文(目标+他人)和完整对话,以评估对对话结构的敏感性。
  • 使用 10 折交叉验证并固定随机种子,以确保可复现性,并与 Essays 数据集上先前工作的结果保持一致。
  • 通过中位数分割将三位标注者的评分转换为二元标签,使用 Fleiss’ kappa(20.54%)和成对 kappa(54.92%)测量标注者间一致性。

实验结果

研究问题

  • RQ1与传统模型相比,像 BERT 和 RoBERTa 这类预训练上下文嵌入是否能在独白数据上显著提升个性识别性能?
  • RQ2当应用于独白与多人对话时,个性识别模型的性能有何差异?
  • RQ3不同输入格式(单人说话者、带上下文、完整对话)对基于对话的个性识别模型性能有何影响?
  • RQ4注意力神经网络在多大程度上增强了对话文本中个性特征的建模?
  • RQ5基于对话的个性识别标注质量与基于独白的数据集相比如何?影响标注者间一致性的因素有哪些?

主要发现

  • 所提方法在 Essays 数据集上将最先进平均准确率提升了 2.49%,在五个人格特质中均取得提升,其中 RoBERTa 在四项特质中表现最佳。
  • 在 FriendsPersona 数据集上,RoBERTa 在全部 15 种组合(五大人格特质 × 三种输入格式)中取得 10 次最高准确率,其中在单人格式下对开放性(OPN)的准确率最高,达 68.47%。
  • 在所有特质上,单人(S)格式始终优于 S+C 和 F 格式,表明基于独白式输入训练的模型泛化能力更强,优于使用完整对话的模型。
  • HAN 在 FriendsPersona 上取得三项前 15 名结果,表现优于其在 Essays 上的表现,表明层次注意力在建模说话者特定内容时能从对话结构中获益。
  • 尽管由于主观性导致 Fleiss’ kappa 仅为 20.54%,但标注过程仍生成了一个可靠的基准数据集,标注者间一致性仍足以支持模型训练与评估。
  • 在两个数据集中,BERT 和 RoBERTa 均未在尽责性(CON)上超越其他模型,表明该特质可能仅靠文本线索难以捕捉。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。