Skip to main content
QUICK REVIEW

[论文解读] Learning a face space for experiments on human identity

Jordan W. Suchow, Joshua C. Peterson|arXiv (Cornell University)|May 19, 2018
Face recognition and analysis参考文献 15被引用 7
一句话总结

该论文提出了一种变分自编码器,其解码器为自回归模型,基于Humanæ数据集训练,以学习一种逼真且与心理认知一致的人脸表征空间,用于人类身份表征。该模型可实现高质量、可导航的虚构身份生成,并在无需专家参与的快速‘警察素描’生成中成功应用交互式进化计算,人类参与者在心理物理学图灵测试中失败率极高。

ABSTRACT

Generative models of human identity and appearance have broad applicability to behavioral science and technology, but the exquisite sensitivity of human face perception means that their utility hinges on the alignment of the model's representation to human psychological representations and the photorealism of the generated images. Meeting these requirements is an exacting task, and existing models of human identity and appearance are often unworkably abstract, artificial, uncanny, or biased. Here, we use a variational autoencoder with an autoregressive decoder to learn a face space from a uniquely diverse dataset of portraits that control much of the variation irrelevant to human identity and appearance. Our method generates photorealistic portraits of fictive identities with a smooth, navigable latent space. We validate our model's alignment with human sensitivities by introducing a psychophysical Turing test for images, which humans mostly fail. Lastly, we demonstrate an initial application of our model to the problem of fast search in mental space to obtain detailed "police sketches" in a small number of trials.

研究动机与目标

  • 开发一种与人类对人脸的心理表征一致的人类身份生成模型,其潜在空间具有心理认知对齐性。
  • 生成逼真、多样化且无诡异感的人脸肖像,反映人类视觉多样性。
  • 实现高效的人机协同搜索,以获取心理层面的身份表征,例如在警察素描中的应用。
  • 通过心理物理学图灵测试验证模型的真实性,即人类无法可靠区分生成图像与真实人脸。
  • 展示潜在空间在利用交互式进化计算实现快速、准确的身份描述检索方面的实用性。

提出的方法

  • 在Humanæ数据集的3,353张正面人脸图像上,训练了一个变分自编码器(PixelVAE),其解码器为自回归结构,以学习解耦且平滑的人脸潜在空间。
  • 通过心理物理学图灵测试评估生成图像的真实性,测量人类参与者区分真实与虚假人脸的能力。
  • 采用基于自然进化策略的交互式进化计算,根据人类对人脸与口头描述相似度的评分,优化潜在空间中的点。
  • 每轮搜索以潜在空间中的一个种子点初始化,并通过基于参与者评分和高斯噪声扰动的梯度估计进行更新。
  • 采用众包评分系统,每轮由10名参与者对图像进行评分,计算适应度分数,以引导搜索向目标身份逼近。
  • 应用图像超分辨率技术,在保持身份一致性的同时提升生成的512×512人脸图像的分辨率与质量。

实验结果

研究问题

  • RQ1所学习的人脸潜在空间在多大程度上反映了人类对人脸身份的心理表征?
  • RQ2生成模型能否在心理物理学图灵测试中生成与真实人脸难以区分的逼真人脸图像?
  • RQ3在潜在空间中,交互式进化计算在基于口头描述检索身份时,其效率如何?
  • RQ4该模型能否从低分辨率或含噪的种子点生成高保真度且身份一致的人脸图像?
  • RQ5潜在空间在多大程度上具有通用性,能够表征多样化的人类身份?

主要发现

  • 模型实现了高度逼真,人类参与者在心理物理学图灵测试中失败率极高,表明生成图像与真实肖像几乎无法区分。
  • 与以往方法相比,交互式进化计算在潜在空间中将所需的人类判断次数减少了十倍,用于生成‘警察素描’。
  • 该模型成功生成了逼真、512×512分辨率的虚构身份人脸图像,潜在空间平滑且可导航,伪影极少。
  • 图像超分辨率技术在不改变底层潜在表示的前提下,有效提升了图像分辨率与质量,同时保持了身份一致性。
  • 尽管Humanæ数据集规模有限,但其受控的、以身份为中心的多样性,使得模型能够学习到高度代表性与多样化的人脸潜在空间。
  • 潜在空间与人类感知相似性表现出强一致性,这从人类引导的搜索能成功从口头描述中检索目标身份得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。