[论文解读] Author2Vec: A Framework for Generating User Embedding
Author2Vec 提出了一种端到端的神经网络框架,通过利用 BERT 编码的句子表征以及在 10,000 名 Reddit 用户上提出的新型无监督预训练目标——作者身份分类,生成用户嵌入。该方法在下游任务(如抑郁检测和 MBTI 性格分类)中优于传统的基于计数和基于预测的基线模型,在无需微调的情况下实现了最先进(SOTA)的 F1 分数。
Online forums and social media platforms provide noisy but valuable data every day. In this paper, we propose a novel end-to-end neural network-based user embedding system, Author2Vec. The model incorporates sentence representations generated by BERT (Bidirectional Encoder Representations from Transformers) with a novel unsupervised pre-training objective, authorship classification, to produce better user embedding that encodes useful user-intrinsic properties. This user embedding system was pre-trained on post data of 10k Reddit users and was analyzed and evaluated on two user classification benchmarks: depression detection and personality classification, in which the model proved to outperform traditional count-based and prediction-based methods. We substantiate that Author2Vec successfully encoded useful user attributes and the generated user embedding performs well in downstream classification tasks without further finetuning.
研究动机与目标
- 开发一种端到端的用户嵌入系统,从社交媒体文本中捕捉用户的内在属性,而无需针对特定任务进行微调。
- 通过学习具有区分性且可泛化的用户表征,解决用户属性分类中人工特征工程的局限性。
- 评估预训练的用户嵌入在极少适应的情况下是否能跨多种下游任务实现泛化。
- 探索在作者身份分类上进行无监督预训练作为学习有意义用户表征的代理目标的有效性。
提出的方法
- 该框架使用 BERT 将用户帖子编码为上下文相关的句子嵌入。
- 利用这些句子嵌入,应用一种新型的无监督预训练目标——从一组候选作者中预测某篇帖子的作者。
- 通过平均池化等方法,聚合同一用户所有帖子的 BERT 编码表征,生成用户嵌入。
- 在 10,000 名 Reddit 用户上进行预训练,使用经过筛选的高质量帖子,以避免因主题相关的内容导致的数据泄露。
- 预训练完成后,使用逻辑回归在下游分类任务中评估学习到的用户嵌入,且不再进行进一步微调。
- 该框架在两个基准上进行评估:抑郁检测和 MBTI 性格分类,使用精心筛选的 Reddit 数据集。
实验结果
研究问题
- RQ1基于作者身份分类的无监督预训练目标是否能有效学习到有意义的用户嵌入?
- RQ2预训练的用户嵌入在无需微调的情况下,能否在下游分类任务中实现良好泛化?
- RQ3Author2Vec 在捕捉用户属性方面是否优于传统的基于计数的方法(如 LDA、TF-IDF-LSI)和基于预测的方法(如 Word2Vec)?
- RQ4所学习到的嵌入在多大程度上编码了用户的内在特征,如人格和心理健康状况?
主要发现
- 在 MBTI 分类任务中,Author2Vec 在 E/I 维度上取得 0.690 的 F1 分数,S/N 维度上为 0.766,T/F 维度上为 0.681,J/P 维度上为 0.610,优于所有基线模型。
- 在抑郁检测基准上,该模型表现出色,可视化分析中性别分类的 F1 分数达到 93.3%。
- 16 种类型 MBTI 分类的混淆矩阵显示聚类效果改善,且误分类减少,尤其体现在较少见的类型上。
- 该模型在类别不平衡的数据集上表现一致,其 F1 分数在罕见类别上优于基线方法。
- 在 MBTI 基准的所有维度上,Author2Vec 显著优于 TF-IDF-LSI、LDA 和 Word2Vec 基线模型。
- 结果表明,无监督的作者身份分类目标成功捕捉到了非平凡的、内在的用户语言和行为模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。