Skip to main content
QUICK REVIEW

[论文解读] Myers-Briggs Personality Classification and Personality-Specific Language Generation Using Pre-trained Language Models

Sedrick Scott Keh, I-Tsun Cheng|arXiv (Cornell University)|Jul 15, 2019
Mental Health via Writing参考文献 8被引用 35
一句话总结

本文对 BERT 进行微调以从论坛文本预测 MBTI 类型,并探索基于性格的语言生成,报告在 PersonalityCafe 数据集上达到最先进的 MBTI 分类准确率,并按类型详细给出生成损失。

ABSTRACT

The Myers-Briggs Type Indicator (MBTI) is a popular personality metric that uses four dichotomies as indicators of personality traits. This paper examines the use of pre-trained language models to predict MBTI personality types based on scraped labeled texts. The proposed model reaches an accuracy of $0.47$ for correctly predicting all 4 types and $0.86$ for correctly predicting at least 2 types. Furthermore, we investigate the possible uses of a fine-tuned BERT model for personality-specific language generation. This is a task essential for both modern psychology and for intelligent empathetic systems.

研究动机与目标

  • 以 MBTI 作为性格度量标准来驱动研究,并利用预训练语言模型从文本中预测 MBTI 类型。
  • 研究在给定 MBTI 类型条件下生成文本的可行性,以用于具共情能力的系统。
  • 将基于 BERT 的 MBTI 分类与现有方法进行比较,并建立实际可行的性能基线。
  • 探索数据抓取、预处理和微调的具体做法,以最大化 MBTI 预测准确性。

提出的方法

  • 对 BERT (bert-base-uncased) 进行序列分类微调,使用 [CLS]/[SEP] 标记和交叉熵损失。
  • 文本预处理:小写化,使用 BERT 分词器进行分词,移除显式的 MBTI 提及,并用占位符替换。
  • 对学习率、最大序列长度和训练轮数进行超参数调整;最佳结果在 lr=1e-5、maxlen=128、30 轮时报告。
  • 使用对四字母 MBTI 的严格预测准确度以及逐字母类别的准确度(I/E、N/S、F/T、P/J)进行评估。
  • 训练一个单独的基于 BERT 的掩码语言模型,用于跨 16 种 MBTI 类型的个性化文本生成,并报告各类型的损失。

实验结果

研究问题

  • RQ1基于 BERT 的模型是否能够从用户生成的文本中准确分类 MBTI 类型?
  • RQ2在条件给定特定性格类型时,基于 MBTI 的文本生成表现如何?
  • RQ3超参数对 MBTI 分类准确率的影响有哪些?哪些 MBTI 类别更容易区分?
  • RQ4不同 MBTI 类型的生成质量存在哪些差异?哪些二分法对生成损失影响最大?

主要发现

  • 所达到的最佳 MBTI 分类准确率为 0.4797(约等于 0.48),使用 lr=1e-5、maxlen=128、30 轮。
  • 在 lr=1e-4、最大序列长度 128、5 轮下的分类准确率为 0.4701;总体最佳约为 0.48。
  • 按逐字母评估时,E/I 和 F/T 比较容易区分;P/J 相对更难。
  • 相较于前期工作,PersonalityCafe 数据上的 BERT 优于若干基线方法(如逻辑回归 0.190、SVM 0.370、LSTM 0.380)。
  • 在多种外向型性格类型中,语言生成损失通常低于 0.02,ENFJ/ESFJ/ESFP/ESTJ 显示出最低的损失。
  • 外向型(E)类型的生成损失往往低于内向型,表明 E 类数据可用性更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。