[论文解读] Optimal Transport-based Identity Matching for Identity-invariant Facial Expression Recognition
本文提出ELIM,一种新颖的身份不变性面部表情识别框架,利用最优传输技术匹配跨身份的相似面部表情,使模型能够学习到对身份变化不敏感的表征。通过将跨身份的表情相似性建模为运输成本,并利用Sinkhorn-Knopp迭代求解,ELIM在野生数据集上的PCC/CCC性能相比最先进方法最高提升10%。
Identity-invariant facial expression recognition (FER) has been one of the challenging computer vision tasks. Since conventional FER schemes do not explicitly address the inter-identity variation of facial expressions, their neural network models still operate depending on facial identity. This paper proposes to quantify the inter-identity variation by utilizing pairs of similar expressions explored through a specific matching process. We formulate the identity matching process as an Optimal Transport (OT) problem. Specifically, to find pairs of similar expressions from different identities, we define the inter-feature similarity as a transportation cost. Then, optimal identity matching to find the optimal flow with minimum transportation cost is performed by Sinkhorn-Knopp iteration. The proposed matching method is not only easy to plug in to other models, but also requires only acceptable computational overhead. Extensive simulations prove that the proposed FER method improves the PCC/CCC performance by up to 10\% or more compared to the runner-up on wild datasets. The source code and software demo are available at https://github.com/kdhht2334/ELIM_FER.
研究动机与目标
- 为解决由于表情风格的跨身份差异导致的面部表情识别(FER)中身份依赖的性能下降问题。
- 开发一种显式建模并补偿面部表情中身份偏移的方法,提升对未见身份的泛化能力。
- 通过基于最优传输的匹配学习身份间的相对表情差异,实现身份不变的FER。
- 提升VA(效价-唤醒度)FER性能,特别是在表达标签对不一致的情况下。
提出的方法
- 将身份匹配建模为最优传输(OT)问题,将不同身份之间的特征相似性视为运输成本。
- 使用Sinkhorn-Knopp迭代计算最小成本的最优传输方案,识别不同身份间相似的表情对。
- 从匹配的身份对中计算ID偏移向量,以量化和建模身份特异的表情差异。
- 将最优传输流中的相关性权重整合到损失函数中,指导训练过程中的风险最小化。
- 采用多任务学习目标,结合主FER损失、PCC/CCC损失和VA回归损失,以增强泛化能力。
- 将框架设计为可即插即用,可与现有FER模型兼容,仅需适度的计算开销。
实验结果
研究问题
- RQ1最优传输能否有效用于识别不同身份间相似的面部表情,从而提升身份不变的FER性能?
- RQ2通过最优传输建模跨身份的表情偏移,如何提升在野生、分布外数据集上的性能?
- RQ3该方法在测试未见身份时,能在多大程度上减少性能下降?
- RQ4训练身份数量如何影响身份匹配机制的性能?
主要发现
- 在野生数据集上,ELIM相比第二名方法,PCC和CCC性能最高提升10%,展现出最先进性能。
- 即使在表达标签对不一致的样本上,模型仍保持高准确率,表明对表情风格差异具有鲁棒性。
- 随着训练身份数量的增加,性能稳步提升,证实了充分的身份多样性对有效匹配的重要性。
- 使用t-SNE的可视化结果表明,ID偏移向量能有效捕捉跨身份的表情差异,验证了该方法的核心假设。
- 消融实验显示,若移除VA损失,性能会下降,表明联合优化对保持表达连续性至关重要。
- 当所有身份间表达效价符号完全相反的罕见情况下,该方法仍具鲁棒性,因为迭代训练可缓解此类极端情况。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。