Skip to main content
QUICK REVIEW

[论文解读] Learning via social awareness: Improving a deep generative sketching model with facial feedback

Natasha Jaques, Jennifer McCleary|arXiv (Cornell University)|Feb 13, 2018
Face recognition and analysis参考文献 9被引用 8
一句话总结

本文提出通过利用人类面部表情的隐式社会反馈来训练深度生成草图模型,以提升输出质量。通过采用潜在约束生成对抗网络(Latent Constraints GAN)优化草图以获得积极情绪反应,该模型生成的草图在美学偏好和情感吸引力方面显著优于原始的 Sketch RNN,该结论通过面部表情分析和人工偏好评分均得到验证。

ABSTRACT

In the quest towards general artificial intelligence (AI), researchers have explored developing loss functions that act as intrinsic motivators in the absence of external rewards. This paper argues that such research has overlooked an important and useful intrinsic motivator: social interaction. We posit that making an AI agent aware of implicit social feedback from humans can allow for faster learning of more generalizable and useful representations, and could potentially impact AI safety. We collect social feedback in the form of facial expression reactions to samples from Sketch RNN, an LSTM-based variational autoencoder (VAE) designed to produce sketch drawings. We use a Latent Constraints GAN (LC-GAN) to learn from the facial feedback of a small group of viewers, by optimizing the model to produce sketches that it predicts will lead to more positive facial expressions. We show in multiple independent evaluations that the model trained with facial feedback produced sketches that are more highly rated, and induce significantly more positive facial expressions. Thus, we establish that implicit social feedback can improve the output of a deep learning model.

研究动机与目标

  • 探究人类面部表情的隐式社会反馈是否可作为改进生成式人工智能模型的内在驱动力。
  • 解决当前深度学习模型依赖显式监督的局限性,引入社会反馈作为一种隐式、实时的奖励形式。
  • 探索社会意识是否能促使生成模型产生更具泛化能力且与人类对齐的表征。
  • 评估面部表情反馈是否能有效引导基于变分自编码器(VAE)的草图生成器,以生成更受欢迎且更具情感吸引力的输出。

提出的方法

  • 本研究采用 Sketch RNN,一种基于LSTM的变分自编码器,其输出采用混合密度网络(Mixture Density Network)架构,用于生成草图绘画。
  • 通过面部表情检测系统实时捕捉观众对生成草图的反应(包括愉悦、满足、悲伤、专注等情绪)。
  • 训练潜在约束生成对抗网络(LC-GAN),以生成能最大化预测积极面部表情并最小化负面表情的 VAE 潜在向量。
  • LC-GAN 利用面部反馈作为奖励信号,优化 VAE 的潜在空间,以生成更能引发积极情感反应的草图。
  • 在双盲设置下,通过面部表情指标和人工偏好评分对比 LC-GAN 与原始 Sketch RNN 的生成样本,对模型进行评估。
  • 训练过程仅使用少量面部反馈数据(每类 63–69 个样本),展现出优异的样本效率。

实验结果

研究问题

  • RQ1能否将面部表情形式的隐式社会反馈作为可靠且有效的信号,用于提升生成式AI输出的质量?
  • RQ2是否通过优化模型以获得积极的人类面部反应,可生成更受欢迎且更具情感吸引力的草图?
  • RQ3社会反馈在多大程度上可减少生成建模中对显式人工标注或奖励塑造的依赖?
  • RQ4社会反馈的整合在多大程度上影响了不同草图类别生成草图的泛化能力与真实感?

主要发现

  • LC-GAN 模型生成的草图引发的积极面部表情显著多于原始 Sketch RNN,平均愉悦度显著提升(t(535) = 2.31,p < .05)。
  • LC-GAN 模型还显著减少了负面表情,平均悲伤程度显著下降(t(535) = -2.01,p < .05)。
  • 在人工偏好评估中,LC-GAN 在 4,613 次比较中有 2,843 次被优先选择,差异具有统计学显著性(p < .0001)。
  • LC-GAN 学习到生成更真实、更具美学吸引力的草图,尤其在复杂主题(如犀牛和螃蟹)上表现显著改善,此前这些主题常被绘制得不够理想。
  • 该模型展现出优异的样本效率,仅需每类 63–69 个面部反馈样本即可显著提升性能。
  • 研究观察到面部表情随时间变化,重复暴露后悲伤增加、专注度下降,表明反馈数据存在非平稳性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。