Skip to main content
QUICK REVIEW

[论文解读] Classifying Online Dating Profiles on Tinder using FaceNet Facial Embeddings

Charles F. Jekel, Raphael T. Haftka|arXiv (Cornell University)|Mar 12, 2018
Face recognition and analysis参考文献 12被引用 5
一句话总结

本文提出了一种基于FaceNet面部嵌入的个性化分类模型,用于预测Tinder交友资料的用户偏好。通过从单人头像中提取128维面部特征并训练逻辑回归模型,该方法在仅20张资料后即达到65%的验证准确率,约80张资料后准确率峰值达到73%,表明已达到收益递减点。

ABSTRACT

A method to produce personalized classification models to automatically review online dating profiles on Tinder is proposed, based on the user's historical preference. The method takes advantage of a FaceNet facial classification model to extract features which may be related to facial attractiveness. The embeddings from a FaceNet model were used as the features to describe an individual's face. A user reviewed 8,545 online dating profiles. For each reviewed online dating profile, a feature set was constructed from the profile images which contained just one face. Two approaches are presented to go from the set of features for each face, to a set of profile features. A simple logistic regression trained on the embeddings from just 20 profiles could obtain a 65% validation accuracy. A point of diminishing marginal returns was identified to occur around 80 profiles, at which the model accuracy of 73% would only improve marginally after reviewing a significant number of additional profiles.

研究动机与目标

  • 开发一种个性化分类模型,基于用户过往的喜欢行为预测其在Tinder上的偏好。
  • 探究通过FaceNet提取的面部特征是否能有效表征并预测交友资料偏好。
  • 确定构建可靠、用户特定分类模型所需的最少资料数量。
  • 比较不同特征聚合策略在将面部嵌入组合为资料级表征时的表现。
  • 从准确率、真正例率/真负例率以及方差减少角度评估模型性能随训练数据增加的表现。

提出的方法

  • 使用FaceNet(一种深度度量学习模型)从包含单张人脸的资料图片中提取128维面部嵌入。
  • 提出两种特征聚合方法:使用原始128D嵌入向量(i_p)或对多张人脸的嵌入进行平均(i_avg),但最终评估仅使用单人头像。
  • 通过自定义应用程序记录用户在Tinder上的喜欢/不喜欢行为,并存储包括图片、姓名、年龄和个人简介在内的资料元数据。
  • 以逻辑回归作为基础分类器,基于逐步增加的20至8,545张资料的子集进行训练,以评估性能扩展情况。
  • 在训练规模(10至406张资料)上执行10,000次随机交叉验证,以评估模型稳定性并对比随机基线。
  • 通过验证准确率、真正例率(喜欢准确率)和真负例率(不喜欢准确率)对模型进行评估,并在不同训练集规模下可视化结果。

实验结果

研究问题

  • RQ1预训练的FaceNet模型提取的面部嵌入是否能有效预测用户对Tinder资料的偏好?
  • RQ2需要多少张Tinder资料才能训练出显著优于随机猜测的分类模型?
  • RQ3模型准确率在何时达到平台期,表明用户投入的边际收益递减?
  • RQ4不同特征聚合策略如何影响模型性能与稳定性?
  • RQ5在多次随机训练划分中,模型性能的方差如何变化?随着训练数据增加,方差是否减小?

主要发现

  • 仅用20张Tinder资料训练的逻辑回归模型即达到65%的验证准确率,表明其具备早期有效性。
  • 在约80张资料后,模型准确率达到73%,此后进一步提升微乎其微,表明已达到收益递减点。
  • 在10张资料后,模型的平均验证准确率显著高于随机分类器,证实其具备非随机的预测能力。
  • 当训练数据从81张增至406张时,模型性能的方差显著降低,表明稳定性提升。
  • 模型表现出对“喜欢”的偏向(真正例率),逻辑回归模型在20张资料后实现70%的喜欢准确率和60%的不喜欢准确率。
  • 在10,000次随机训练划分中结果稳健,概率密度函数显示随着训练集增大,性能持续提升且方差减小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。