[论文解读] Affective Faces for Goal-Driven Dyadic Communication
本文提出了一种框架,利用大语言模型(LLMs)和视觉-语言模型(VLMs)生成对话中听者在特定情境下社会适宜的面部表情,其条件基于说话者的言语内容以及听者的意图或个性。通过人工评估和一项新的非脚本化、多样化对话数据集验证,该方法在社会适宜性方面相比基线模型有显著提升。
We introduce a video framework for modeling the association between verbal and non-verbal communication during dyadic conversation. Given the input speech of a speaker, our approach retrieves a video of a listener, who has facial expressions that would be socially appropriate given the context. Our approach further allows the listener to be conditioned on their own goals, personalities, or backgrounds. Our approach models conversations through a composition of large language models and vision-language models, creating internal representations that are interpretable and controllable. To study multimodal communication, we propose a new video dataset of unscripted conversations covering diverse topics and demographics. Experiments and visualizations show our approach is able to output listeners that are significantly more socially appropriate than baselines. However, many challenges remain, and we release our dataset publicly to spur further progress. See our website for video results, data, and code: https://realtalk.cs.columbia.edu.
研究动机与目标
- 建模双人对话中言语与非言语交流之间的动态互动,特别是对言语的面部表情反应。
- 通过基于听者特定因素(如目标、个性或背景)的条件控制,实现对听者行为的调控。
- 解决先前视频生成方法仅关注低层次音频或视觉特征、缺乏高层语义推理的问题。
- 创建一个新数据集,涵盖多样化且非脚本化的视频,以支持多模态、目标驱动的社会互动建模研究。
- 证明LLMs能够有效推理社会语境,从而指导基于视觉的、社会适宜面部表情的生成。
提出的方法
- 该框架使用大语言模型(例如GPT-3)解析说话者的转录文本,并基于听者特定的条件(如关系目标、个性)推断合适的视觉属性。
- 这些推断出的视觉属性随后用于从VLM嵌入的视频检索系统(如CLIP)中检索对应的面部表情视频。
- 该方法同时基于说话者的口语内容和听者的意图进行条件控制,从而在无需对面部表情进行显式监督的情况下实现对情感反应的调控。
- 通过在LLMs中使用少样本提示(few-shot prompting),实现对多样化社会语境的泛化,并推断出社会适宜的反应。
- 该系统将听者视频生成视为一个检索任务,利用视觉-语言模型的嵌入将预测属性与真实视频片段匹配。
- 时间动态未被显式建模,该方法基于关键帧级表示运行,可能导致预测与实际时间点错位。
实验结果
研究问题
- RQ1大语言模型能否有效推理对话的社会语境,以预测适当的听者面部表情?
- RQ2基于听者目标或个性的条件控制在多大程度上提升了生成面部表情的社会适宜性?
- RQ3视觉-语言模型在多大程度上能基于LLM生成的属性检索到社会适宜的听者视频?
- RQ4与基线模型相比,该方法在生成符合人类社会期望的面部表情方面表现如何?
- RQ5该框架的主要失败模式是什么?它们与缺失模态或时间错位有何关联?
主要发现
- 所提方法在生成社会适宜听者面部表情方面显著优于基线模型(包括Learning2Listen),经人工评估验证。
- 人工评估者以统计显著性差异更偏好该系统预测的“社会正确”听者表情,而非“社会错误”预测或Learning2Listen基线。
- 该框架在开放世界听者目标(如个性特征和人际关系动态)上泛化良好,能正确推断出多样化情境下的适当反应。
- 失败案例主要源于缺乏多模态说话者上下文(如面部表情或语调),导致对语气或意图的误判。
- 时间错位是主要限制,表现为预测的听者表情在相关言语事件之前或之后出现,例如在笑点出现前就已开始大笑。
- 语言模型幻觉(尤其是对隐喻或模糊陈述)会导致对说话者意图的错误推断,从而引发不适当听者反应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。