Skip to main content
QUICK REVIEW

[论文解读] Beyond Skin Tone: A Multidimensional Measure of Apparent Skin Color

William Thong, Przemyslaw Joniak|arXiv (Cornell University)|Sep 10, 2023
Evolutionary Psychology and Human BehaviorPsychology被引用 3
一句话总结

本文提出了一种多维肤色度量方法,结合感知明度(L*)与色调角(h*),以捕捉超越单一维度肤色的表观肤色。该方法揭示了计算机视觉数据集与模型中此前隐藏的偏见——尤其针对浅红色与深黄色肤色——并表明公平性评估需超越Fitzpatrick量表,引入色调以实现更全面的偏见检测。

ABSTRACT

This paper strives to measure apparent skin color in computer vision, beyond a unidimensional scale on skin tone. In their seminal paper Gender Shades, Buolamwini and Gebru have shown how gender classification systems can be biased against women with darker skin tones. Subsequently, fairness researchers and practitioners have adopted the Fitzpatrick skin type classification as a common measure to assess skin color bias in computer vision systems. While effective, the Fitzpatrick scale only focuses on the skin tone ranging from light to dark. Towards a more comprehensive measure of skin color, we introduce the hue angle ranging from red to yellow. When applied to images, the hue dimension reveals additional biases related to skin color in both computer vision datasets and models. We then recommend multidimensional skin color scales, relying on both skin tone and hue, for fairness assessments.

研究动机与目标

  • 解决如Fitzpatrick量表等单一维度肤色测量在计算机视觉系统公平性评估中的局限性。
  • 识别并量化图像数据集与模型中与肤色相关的偏见,尤其关注从红色到黄色的色调变化。
  • 开发一种实用、量化且正交的肤色评分方法,结合感知明度(L*)与色调角(h*),以提升公平性基准测试的准确性。
  • 证明当前模型在基于肤色与色调的性别与属性预测中存在显著偏见,而这些偏见在传统仅基于肤色的度量下无法被察觉。
  • 倡导在数据收集、模型训练与部署流程中采用多维肤色量表进行公平性评估。

提出的方法

  • 使用CIELab色彩空间测量图像中的表观肤色,将L*(明度)作为肤色的代理指标,h*(色调角)作为从红色到黄色的肤色色调的代理指标。
  • 将多维肤色评分应用于多样化的计算机视觉数据集(如CelebAMask-HQ)的公平性基准测试,通过沿L*与h*轴生成合成图像扰动。
  • 利用潜在空间操纵技术(如e4e、StyleGAN3、InterfaceGAN)生成在L*与h*上具有受控变化的图像,确保肤色与色调维度之间的正交性。
  • 将模型在扰动图像上的表现与重建版本(非原始图像)进行对比,以隔离肤色变化对预测准确率的因果影响。
  • 在性别与微笑分类任务中开展受控实验,以二元准确率为首要指标,评估多个商业与非商业模型的偏见。
  • 通过证明L*与h*维度之间互不相关,验证其正交性:改变一个维度不会影响另一个维度,而CelebA中的“苍白”属性则与肤色与色调共同变化,因此不适合用于因果效应的隔离。

实验结果

研究问题

  • RQ1常见计算机视觉数据集在多大程度上偏向浅红色肤色,而对深黄色肤色的代表性不足?
  • RQ2在有偏见的数据集上训练的生成模型在输出中如何再现多维肤色偏见?
  • RQ3肤色(L*)与肤色色调(h*)对人脸相关任务(如性别与微笑分类)的模型预测有何因果影响?
  • RQ4当仅依赖单一维度肤色度量时,现有公平性评估方法为何无法检测到偏见?
  • RQ5多维肤色度量能否提升计算机视觉系统中社会相关偏见的检测与缓解?

主要发现

  • 将肤色调浅可使AWS模型在男性样本上的性别分类准确率降低最多达4.16个百分点(从94.82%降至90.66%),表明模型对女性分类存在对较浅肤色的强烈偏见。
  • 将肤色色调向红色方向提升可提高所有模型在男性样本上的性别分类准确率,表明此前未被报道的、对偏红肤色的偏见。
  • 在Azure模型中,肤色更红会使非微笑个体的微笑分类准确率下降11.08个百分点(从80.84%降至69.76%),表明肤色偏红时存在将非微笑误判为微笑的假阳性偏见。
  • 肤色更暗或色调更黄会降低微笑个体的分类准确率,揭示出未被单一维度度量捕捉到的复杂、多维偏见模式。
  • CelebA中的“苍白”属性与肤色和色调共同变化,因此不适合用于隔离因果效应,而本研究使用的L*与h*维度具有正交性,可作为独立、可解释的维度用于公平性基准测试。
  • 所提出的L*与h*度量具有正交性:改变L*不会影响h*,反之亦然,验证了其作为公平性基准测试中独立、可解释维度的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。