[论文解读] Bias and Fairness on Multimodal Emotion Detection Algorithms
本研究探讨了使用语音、文本和视频模态的多模态情感识别系统中的性别偏见。研究发现,仅使用文本的模型在性能与公平性之间达到了最佳平衡,而多模态融合——尤其是加入视频——尽管准确率提升微乎其微,却显著增加了偏见,引发了关于模型设计选择的伦理担忧。
Numerous studies have shown that machine learning algorithms can latch onto protected attributes such as race and gender and generate predictions that systematically discriminate against one or more groups. To date the majority of bias and fairness research has been on unimodal models. In this work, we explore the biases that exist in emotion recognition systems in relationship to the modalities utilized, and study how multimodal approaches affect system bias and fairness. We consider audio, text, and video modalities, as well as all possible multimodal combinations of those, and find that text alone has the least bias, and accounts for the majority of the models' performances, raising doubts about the worthiness of multimodal emotion recognition systems when bias and fairness are desired alongside model performance.
研究动机与目标
- 探究使用语音、文本和视频模态的单模态与多模态情感识别模型中性别偏见的变化情况。
- 评估不同模态组合下的公平性度量指标——统计独立性差异(SP)与机会均等差异(EO)。
- 确定多模态融合是否在不加剧基于性别的差异的情况下提升性能。
- 识别在情感识别系统中,文本、语音或视频模态是否内在地导致更多偏见。
- 评估在多模态模型中加入视频和语音是否在仅获得微小性能提升的情况下,值得付出公平性下降的代价。
提出的方法
- 本研究使用 IEMOCAP 数据集,剔除低置信度和罕见情感标签,构建了一个包含 7,380 个样本、性别比例为 50/50 的平衡数据集。
- 采用训练-验证-测试划分:会话 1–4 用于训练,会话 5 按偶数(验证)和奇数(测试)样本划分,实现 80/10/10 的数据划分。
- 公平性通过两个指标衡量:统计独立性差异(SP)与机会均等差异(EO),其定义基于条件概率对受保护属性(性别)的独立性。
- 采用迁移学习方法训练单模态(语音、文本、视频)与多模态(双模态与三模态)配置的模型。
- 通过性别间 F1 分数差异评估性能,数值越低表示公平性越好。
- 按情感类别与模型配置分别计算统计独立性与机会均等,以评估不同模态下的偏见趋势。
实验结果
研究问题
- RQ1在使用语音、文本和视频的单模态情感识别模型中,性别偏见如何变化?
- RQ2与单模态模型相比,语音、文本和视频的多模态融合是否减少了或放大了性别偏见?
- RQ3在融合模态时,模型性能(F1 分数)与公平性(SP 与 EO)之间的权衡如何?
- RQ4为何包含文本的模型在预测男性与女性愤怒情绪时始终表现出约 10% 的 F1 分数差距?
- RQ5在仅带来微小性能提升的情况下,视频数据的引入在多大程度上损害了公平性?
主要发现
- 仅使用文本的模型表现出最低的偏见,统计独立性差异(SP)为 2.0,机会均等差异(EO)为 1.43,在公平性方面优于所有其他模态。
- 仅使用视频的模型表现出最高的偏见,SP 为 3.0,EO 为 2.32,表明不同性别间的预测率存在显著差异。
- 仅使用语音的模型比视频更少偏见,但比文本更偏见,SP 为 1.0,EO 为 1.82。
- 语音 + 视频双模态融合相比单模态语音增加了偏见,SP 上升至 2.0,EO 上升至 2.22,尽管 F1 分数仅获得适度提升。
- 文本 + 视频融合导致最差的公平性表现,SP 为 6.0,EO 为 3.24,表明预测中存在显著的性别差异。
- 三模态模型(语音 + 文本 + 视频)的公平性指标与仅使用文本的模型相似(SP: 2.0,EO: 2.68),但相比仅使用文本的模型,F1 分数仅获得微小提升,表明融合并未带来显著收益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。