[论文解读] Face-GCN: A Graph Convolutional Network for 3D Dynamic Face Identification/Recognition
该论文提出Face-GCN,一种用于3D动态人脸身份识别的无配准时空图卷积网络,利用3D面部关键点进行建模。通过在每个关键点周围构建局部形状与纹理特征的图,并应用ST-GCN实现联合时空建模,该方法在BU4DFE数据集上采用具有挑战性的跨情绪协议时达到了88.45%的准确率,展示了在无需非刚性配准或密集对应关系情况下的鲁棒性。
Face identification/recognition has significantly advanced over the past years. However, most of the proposed approaches rely on static RGB frames and on neutral facial expressions. This has two disadvantages. First, important facial shape cues are ignored. Second, facial deformations due to expressions can have an impact on the performance of such a method. In this paper, we propose a novel framework for dynamic 3D face identification/recognition based on facial keypoints. Each dynamic sequence of facial expressions is represented as a spatio-temporal graph, which is constructed using 3D facial landmarks. Each graph node contains local shape and texture features that are extracted from its neighborhood. For the classification/identification of faces, a Spatio-temporal Graph Convolutional Network (ST-GCN) is used. Finally, we evaluate our approach on a challenging dynamic 3D facial expression dataset.
研究动机与目标
- 解决依赖中性表情和刚性配准的静态3D人脸识别方法的局限性。
- 通过建模3D面部几何随时间的时序演化,提升在真实场景中的鲁棒性。
- 消除3D人脸网格对齐过程中对非刚性配准和密集点对点对应关系的需求。
- 在统一的GCN框架内实现局部形状与纹理特征的有效早期融合,以提升身份判别能力。
- 在具有挑战性的动态3D面部表情数据集上,采用真实场景下的跨情绪评估协议验证该方法。
提出的方法
- 使用3D人脸对齐方法从动态网格序列中提取3D面部关键点。
- 从每个关键点周围200个点的邻域中提取局部形状与纹理特征,构成时空图中的节点特征。
- 构建时空图,其中节点表示随时间变化的关键点,边编码空间邻近性和时间轨迹。
- 采用改进的时空图卷积网络(ST-GCN),利用归一化邻接矩阵在空间和时间维度上传播特征。
- 图卷积操作通过归一化拉普拉斯矩阵公式化:$\mathbf{f}_{\text{out}} = \mathbf{\Lambda}^{-\frac{1}{2}}(\mathbf{A} + \mathbf{I})\mathbf{\Lambda}^{-\frac{1}{2}}\mathbf{f}_{\text{in}}\mathbf{W}$,实现在非欧几里得图上的消息传递。
- 对输出特征张量应用时间卷积,以建模关键点特征随时间的演化。
实验结果
研究问题
- RQ1基于图的深度学习框架是否能有效建模无非刚性配准的动态3D面部表情?
- RQ2在关键点级别融合局部形状与纹理特征,如何提升动态3D人脸识别中的性能?
- RQ3无配准的ST-GCN方法在具有挑战性的动态3D面部表情数据集上的性能如何,相较于最先进方法表现如何?
- RQ4增加识别难度的跨情绪评估协议如何影响所提方法的泛化能力?
- RQ5时空图卷积是否能比静态或仅基于外观的方法更有效地捕捉因表情变化引起的可区分身份特征?
主要发现
- 所提出的Face-GCN框架在BU4DFE数据集上采用跨情绪评估协议时,实现了88.45%的平均识别准确率,该协议比标准协议更具挑战性。
- 尽管绝对准确率低于最先进方法(如3DS的99.98%和S3DS的99.92%),但所提方法无需非刚性配准,这在真实世界部署中具有显著优势。
- 该框架通过在GCN内实现局部形状与纹理特征的早期融合,成功提升了判别能力,且无需密集对应关系。
- 消融实验证实,形状与纹理特征均对性能有显著贡献,完整模型优于各类消融变体。
- ST-GCN架构有效建模了面部关键点的时序动态,捕捉到与表情相关的形变作为与身份相关的关键特征。
- 结果表明,即使未显式中和面部表情,动态3D面部表情建模依然有效,支持了形变中包含身份相关信息的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。