[论文解读] Interactive Generative Adversarial Networks for Facial Expression Generation in Dyadic Interactions
本文提出了一种两阶段条件生成对抗网络(GAN)框架,根据对话伙伴的情绪状态,生成时序平滑、富有表现力的面部行为(如面部表情和头部姿态),适用于双人互动中的虚拟角色。通过使用条件LSTM或情绪-形状词典来建模面部形状参数,并采用草图到图像的GAN实现高保真图像合成,该方法能够生成真实、多样且支持实时运行的面部反应,准确反映情绪动态与社会模仿行为。
A social interaction is a social exchange between two or more individuals,where individuals modify and adjust their behaviors in response to their interaction partners. Our social interactions are one of most fundamental aspects of our lives and can profoundly affect our mood, both positively and negatively. With growing interest in virtual reality and avatar-mediated interactions,it is desirable to make these interactions natural and human like to promote positive effect in the interactions and applications such as intelligent tutoring systems, automated interview systems and e-learning. In this paper, we propose a method to generate facial behaviors for an agent. These behaviors include facial expressions and head pose and they are generated considering the users affective state. Our models learn semantically meaningful representations of the face and generate appropriate and temporally smooth facial behaviors in dyadic interactions.
研究动机与目标
- 使虚拟角色能够根据对话伙伴的情绪状态,在双人互动中生成自然的非语言面部行为(如面部表情和头部姿态)。
- 基于情绪状态及其强度,建模面部关键点与头部姿态的动态、时序一致的演化过程。
- 开发一种支持实时运行、富有表现力的面部生成系统,支持虚拟角色的社会模仿与情绪响应能力。
- 通过两阶段GAN架构将草图生成与图像合成解耦,提升生成面部图像的质量与真实感。
提出的方法
- 采用两阶段生成框架:首先根据情绪状态和潜在向量 z 生成面部草图,然后从草图生成高保真面部图像。
- 使用条件生成对抗网络(CGAN),通过表示一方互动者情绪状态(如喜悦、愤怒、恐惧)的条件向量,引导面部行为的生成。
- 采用学习得到的情绪-形状词典或条件LSTM来建模面部形状参数,以编码时序动态并确保帧间过渡平滑。
- 从刚性与非刚性面部形状参数的联合学习分布中采样潜在向量 z,以保证语义合理性和多样性。
- 采用两步训练策略:每次判别器更新后,对生成器进行两次更新,以稳定训练过程并避免模式崩溃。
- 在生成器与判别器网络中均采用残差U-Net结构,结合卷积-BatchNorm-ReLU模块,以提升特征学习能力与训练稳定性。
实验结果
研究问题
- RQ1如何根据对话伙伴的情绪状态,以时序平滑且语义合理的方式生成面部行为(如面部表情与头部姿态)?
- RQ2条件LSTM与情绪-形状词典在建模面部形状参数时序动态方面,性能表现如何比较?
- RQ3两阶段GAN(草图到图像)生成的面部图像质量是否显著优于直接从潜在空间映射到图像的单阶段GAN?
- RQ4与无历史上下文的方法相比,通过LSTM引入历史上下文,对面部表情生成的准确度与平滑度有何影响?
- RQ5生成的面部行为在多大程度上能够体现双人互动中的社会模仿与情绪响应特性?
主要发现
- 情绪-形状词典方法生成的面部表情序列比条件LSTM更平滑,后者因对长历史进行平均而出现帧间突变。
- 具有100帧历史重叠的条件LSTM(MSE = 0.101)比无重叠版本(MSE = 0.183)的均方误差更低,表明上下文记忆可提升预测准确性。
- 两阶段草图-图像GAN生成的面部图像质量显著优于单阶段GAN,证明中间草图表示有助于解耦身份与表情。
- 情绪-形状词典方法可实现无需前一帧历史的实时推理,适用于交互式应用场景。
- 尽管条件LSTM生成的序列不够平滑,但其生成过程具有确定性,便于评估与复现。
- 该框架成功生成了多样化、富有表现力且时序一致的面部行为,能够准确反映底层情绪状态的语义与强度变化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。