[论文解读] Fusing Multifaceted Transaction Data for User Modeling and Demographic Prediction
本文提出了一种端到端的深度学习方法,通过融合多种类别型交易序列数据(如商户类型和交易类别)以及辅助关系数据,学习稳健的用户表征,用于多任务人口统计预测。该方法利用学习到的嵌入表示和早停策略,在性别、婚姻状况和教育程度预测任务上均达到当前最优性能,相比基线模型提升数个百分点。
Inferring user characteristics such as demographic attributes is of the utmost importance in many user-centric applications. Demographic data is an enabler of personalization, identity security, and other applications. Despite that, this data is sensitive and often hard to obtain. Previous work has shown that purchase history can be used for multi-task prediction of many demographic fields such as gender and marital status. Here we present an embedding based method to integrate multifaceted sequences of transaction data, together with auxiliary relational tables, for better user modeling and demographic prediction.
研究动机与目标
- 为解决在隐私约束和用户信息不完整的情况下,从交易数据中推断性别、婚姻状况和教育程度等敏感人口统计属性的挑战。
- 通过利用交易序列作为人口统计信息的代理,提升金融应用中的用户建模能力。
- 开发一种统一的端到端框架,整合异构的交易序列与结构化关系数据,实现多任务人口统计预测。
- 探索学习到的用户表征在检测人生事件和账户泄露方面的能力,超越直接个性化应用。
提出的方法
- 该方法使用嵌入函数将类别型交易元素(如商户ID)映射为稠密向量表示,序列级表征通过元素嵌入的平均值生成。
- 每条交易序列通过在学习到的嵌入上进行平均池化,转换为固定大小的向量,从而为下游建模提供一致的输入尺寸。
- 用户表征通过拼接嵌入序列与辅助关系特征(如账户类型、收入)后,经由全连接前馈网络生成。
- 模型采用多任务学习,通过共享用户表征联合预测多个人口统计属性(如性别、教育程度)。
- 在嵌入后使用1–2层全连接层已足够,表明大部分表征能力来源于序列嵌入机制。
- 模型在500个周期内端到端训练,并采用早停策略;评估了两种变体:多任务训练与按目标微调。
实验结果
研究问题
- RQ1能否有效融合多条类别型交易数据序列与关系数据,以提升人口统计预测的准确率?
- RQ2与按目标微调相比,采用共享表征的多任务学习是否能减少过拟合并提升泛化能力?
- RQ3嵌入维度和网络深度等设计选择如何影响人口统计预测中的模型性能?
- RQ4学习到的用户表征在多大程度上可用于检测人生事件或账户泄露,而不仅限于直接的人口统计推断?
- RQ5该方法能否作为使用原始交易数据进行用户建模的隐私保护替代方案?
主要发现
- 所提方法在所有人口统计预测任务中均优于三种基线模型(arg-max、堆叠法、PCA),性别和婚姻状况预测的准确率提升达数个百分点,教育程度预测提升不足1%。
- 多任务模型的性能优于按目标微调,表明联合优化提供了正则化效果,有助于减少过拟合。
- 将嵌入维度从10增加到50带来最大性能提升;进一步增至100仅带来微小改进。
- 在嵌入后使用1–2层全连接层已足够,表明序列嵌入机制已捕获了大部分必要的表征能力。
- 模型在无需微调的情况下仍保持高准确率,且在各类人口统计属性上结果均具鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。