[论文解读] Facial Expression Phoenix (FePh): An Annotated Sequenced Dataset for Facial and Emotion-Specified Expressions in Sign Language
本论文提出了FePh,这是首个公开可用的、针对手语的带标注序列面部表情数据集,源自RWTH-PHOENIX-Weather 2014数据集。该数据集包含3,000多张半模糊、动态的面部图像,涵盖多样的头部姿态、运动以及七种基本情绪和一个“无”类别的表情标签,支持多模态手语与手势识别研究。
Facial expressions are important parts of both gesture and sign language recognition systems. Despite the recent advances in both fields, annotated facial expression datasets in the context of sign language are still scarce resources. In this manuscript, we introduce an annotated sequenced facial expression dataset in the context of sign language, comprising over $3000$ facial images extracted from the daily news and weather forecast of the public tv-station PHOENIX. Unlike the majority of currently existing facial expression datasets, FePh provides sequenced semi-blurry facial images with different head poses, orientations, and movements. In addition, in the majority of images, identities are mouthing the words, which makes the data more challenging. To annotate this dataset we consider primary, secondary, and tertiary dyads of seven basic emotions of "sad", "surprise", "fear", "angry", "neutral", "disgust", and "happy". We also considered the "None" class if the image's facial expression could not be described by any of the aforementioned emotions. Although we provide FePh as a facial expression dataset of signers in sign language, it has a wider application in gesture recognition and Human Computer Interaction (HCI) systems.
研究动机与目标
- 解决手语情境下带标注面部表情数据集稀缺的问题,该问题阻碍了多模态手语识别研究的进展。
- 提供一种基于视觉的、真实世界的数据集,包含动态面部表情、头部姿态变化与运动,以更真实地反映自然手语的使用场景。
- 通过提供七种基本情绪和一个“无”类别的详细情绪标注,支持手语中面部表情识别的研究。
- 通过将面部表情数据与RWTH-PHOENIX-Weather 2014数据集中已有的手势形状标注相结合,支持多模态系统的发展。
- 推动手势识别与人机交互(HCI)等更广泛的应用,超越手语识别的范畴。
提出的方法
- 从公共电视台PHOENIX的日常新闻与天气预报视频中提取超过3,000张面部图像,聚焦于面部表情清晰可见的手语者。
- 使用七种基本情绪:'sad'(悲伤)、'surprise'(惊讶)、'fear'(恐惧)、'angry'(愤怒)、'neutral'(中性)、'disgust'(厌恶)、'happy'(快乐)以及一个'None'(无法分类)类别,对每张图像进行主要、次要和三级情绪对标注。
- 通过保持原始视频帧的顺序,保留时间序列信息,支持对动态面部表情变化过程的分析。
- 从RWTH-PHOENIX-Weather 2014多说话人数据集中选取数据,以确保与连续手语识别领域既有的基准保持一致。
- 采用多层次标注方案,以捕捉细微的情绪表达,包括共现情绪(如'surprise_fear'),提升情绪标注的粒度。
- 通过从自然广播视频中选取帧,确保头部姿态、朝向与运动的多样性,提升数据集的真实感与挑战性。
实验结果
研究问题
- RQ1能否从广播视频数据中有效构建大规模、真实世界的手语情境面部表情数据集?
- RQ2手语中的面部表情在多大程度上与特定手势形状相关联?这种关联能否被定量测量?
- RQ3带有头部运动与姿态变化的动态面部表情在多大程度上影响手语识别模型的性能?
- RQ4面部表情与手势形状数据的整合能否提升多模态手语识别系统的准确性?
- RQ5不同手势形状类别中面部表情的分布与频率如何?是否存在有意义的语义或语法关联?
主要发现
- FePh数据集包含从真实广播视频中提取的超过3,000张面部图像,涵盖多样的头部姿态、运动以及半模糊状态。
- 发现手势形状类别与特定面部表情之间存在显著相关性,例如手势形状类别'3'与'fear'(恐惧)的相关系数为0.697,与'surprise'(惊讶)的相关系数为0.383。
- 热力图分析证实,某些面部表情(如'fear')在特定手势形状中被不成比例地频繁使用,表明其具有语法或情感上的重要性。
- 数据集显示,相同的手势形状可与不同的面部表情配对,凸显了面部表情在语义消歧中的关键作用。
- 引入'None'类别标注凸显了真实世界面部表情标注的复杂性,表明并非所有表情都能归入基本情绪类别。
- 该数据集通过与现有的RWTH-PHOENIX-Weather 2014 MS Handshapes数据集结合,为未来多模态学习提供了支持,成为手语识别研究的综合性资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。