[论文解读] Multiple Appropriate Facial Reaction Generation in Dyadic Interaction Settings: What, Why and How?
本文首次在文献中提出双人互动中的多组合适当面部反应生成(fMARG)这一新任务,提出一种基于深度学习的框架,用于预测、生成并评估多种情境合适的面部反应。该研究建立了首个客观评估指标——准确性、多样性、真实性和同步性,证明模型能够根据不同情境对同一说话者行为生成多样化、逼真且时间对齐的面部反应。
According to the Stimulus Organism Response (SOR) theory, all human behavioral reactions are stimulated by context, where people will process the received stimulus and produce an appropriate reaction. This implies that in a specific context for a given input stimulus, a person can react differently according to their internal state and other contextual factors. Analogously, in dyadic interactions, humans communicate using verbal and nonverbal cues, where a broad spectrum of listeners' non-verbal reactions might be appropriate for responding to a specific speaker behaviour. There already exists a body of work that investigated the problem of automatically generating an appropriate reaction for a given input. However, none attempted to automatically generate multiple appropriate reactions in the context of dyadic interactions and evaluate the appropriateness of those reactions using objective measures. This paper starts by defining the facial Multiple Appropriate Reaction Generation (fMARG) task for the first time in the literature and proposes a new set of objective evaluation metrics to evaluate the appropriateness of the generated reactions. The paper subsequently introduces a framework to predict, generate, and evaluate multiple appropriate facial reactions.
研究动机与目标
- 首次在文献中定义多组合适当面部反应生成(fMARG)任务,以解决双人互动中生成多种合适非语言反应缺乏系统研究的问题。
- 开发一种框架,根据上下文和个体差异,对单一说话者行为预测、生成并评估多种合适的面部反应。
- 引入一组客观评估指标——准确性、多样性、真实性和同步性,以评估生成面部反应的质量,超越主观人工判断。
- 通过基于相似性阈值和真实反应分布的上下文感知策略,实现对合适面部反应的自动标注。
- 验证该框架能够生成多样化、逼真且时间同步的面部反应,使其与双人互动中的人类行为规范相一致。
提出的方法
- 该框架使用基于深度学习的模型,从单一说话者行为生成多个面部反应(每个输入生成α个),并根据上下文和听者特定状态进行条件控制。
- 采用相似性阈值(T)判断生成的反应是否合适,通过计算生成反应与同一情境下真实面部反应之间的余弦相似度。
- 准确性指标通过计算与数据集中至少一个真实合适反应相似度超过阈值的生成反应所占比例来计算。
- 多样性通过面部反应方差(FRVar)、生成反应之间的均方误差总和(S-MSE)以及跨条件多样性(FRDvs)进行衡量,以确保输出多样化。
- 真实性通过生成反应与真实面部反应分布之间的弗雷chet inception距离(FID)进行评估。
- 同步性通过说话者行为与生成面部反应时间序列之间的时间延迟互相关(TLCC)进行评估,以确保时间对齐。

实验结果
研究问题
- RQ1在双人互动中,什么定义了适当的面部反应?对于同一说话者行为,如何实现多种适当反应共存?
- RQ2如何以情境感知的方式客观评估生成面部反应的适当性、多样性、真实性和同步性?
- RQ3深度学习框架能否对单一说话者行为生成多个不同、逼真且时间同步的面部反应?
- RQ4上下文和个体差异如何影响双人互动中适当面部反应的生成?
- RQ5哪些客观指标能够可靠评估多组合适当面部反应生成的质量,而无需依赖主观人工评价?
主要发现
- 所提出的fMARG框架能够为每个输入说话者行为成功生成多个不同的面部反应,表现出生成输出之间高度的多样性。
- 准确性指标表明,相当大比例的生成反应与真实合适反应相似,基于阈值的相似性策略实现了可靠的适当性评估。
- 多样性指标(FRVar、S-MSE、FRDvs)证实,该模型在不同输入条件内部及之间均能生成多样化的面部反应。
- 通过FID测量的真实性得分表明,生成的面部反应在视觉和统计分布上均与真实人类反应高度接近。
- 同步性指标(FRSyn)证实,生成的面部反应在时间上与说话者行为对齐,反映出自然的互动动态。
- 该框架通过使用客观、可复现的指标,为面部反应生成建立了新的基准,推动了情感计算与人机交互领域的未来发展。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。