[论文解读] FairSeg: A Large-Scale Medical Image Segmentation Dataset for Fairness Learning Using Segment Anything Model with Fair Error-Bound Scaling
本论文提出了Harvard-FairSeg,这是首个用于公平性学习的大规模医学图像分割数据集,包含10,000张视网膜影像,附带视盘和视杯的像素级标注。该研究提出了一种公平误差边界缩放(FEBS)损失函数,通过基于各身份群体的误差上限重新加权训练损失,提升了使用Segment Anything Model(SAM)和TransUNet主干网络的分割模型的公平性,FEBS在种族、民族、性别和语言群体中均实现了最先进的公平性加权Dice分数。
Fairness in artificial intelligence models has gained significantly more attention in recent years, especially in the area of medicine, as fairness in medical models is critical to people's well-being and lives. High-quality medical fairness datasets are needed to promote fairness learning research. Existing medical fairness datasets are all for classification tasks, and no fairness datasets are available for medical segmentation, while medical segmentation is an equally important clinical task as classifications, which can provide detailed spatial information on organ abnormalities ready to be assessed by clinicians. In this paper, we propose the first fairness dataset for medical segmentation named Harvard-FairSeg with 10,000 subject samples. In addition, we propose a fair error-bound scaling approach to reweight the loss function with the upper error-bound in each identity group, using the segment anything model (SAM). We anticipate that the segmentation performance equity can be improved by explicitly tackling the hard cases with high training errors in each identity group. To facilitate fair comparisons, we utilize a novel equity-scaled segmentation performance metric to compare segmentation metrics in the context of fairness, such as the equity-scaled Dice coefficient. Through comprehensive experiments, we demonstrate that our fair error-bound scaling approach either has superior or comparable fairness performance to the state-of-the-art fairness learning models. The dataset and code are publicly accessible via https://ophai.hms.harvard.edu/datasets/harvard-fairseg10k.
研究动机与目标
- 为解决缺乏大规模、公开可用的医学分割数据集,这些数据集明确设计用于公平性评估与去偏,提出研究目标。
- 开发一种新颖的公平性感知损失函数——公平误差边界缩放(FEBS),在训练过程中针对表现较差的人群群体中的困难样本进行优化。
- 引入一种新的公平性加权评估指标,如公平性加权Dice系数,以公平比较不同敏感属性下的分割性能。
- 在多种人口统计群体——种族、民族、性别和语言——之间对医学分割任务的公平性表现进行基准测试。
- 证明FEBS在不牺牲整体性能的前提下提升了公平性,尤其对代表性不足的群体(如非裔和西班牙裔个体)具有显著改善。
提出的方法
- Harvard-FairSeg数据集包含10,000张SLO视网膜影像,附带视盘和视杯的像素级标注,经过精心筛选,涵盖包括种族、民族、性别和语言在内的多样化人口统计属性。
- 所提出的公平误差边界缩放(FEBS)损失函数根据每个身份群体的误差上限动态调整交叉熵损失的权重,优先关注表现较差群体中的难样本。
- FEBS使用γ加权缩放因子(实验中设为1.0),以平衡各群体最大训练误差对整体损失函数的贡献。
- 该方法在两种分割主干网络上应用:SAMed(微调后的SAM)和TransUNet,支持不同架构间的比较。
- 引入一种新的公平性加权指标,如ES-Dice,通过衡量不同人口统计群体间的性能公平性,而非仅关注平均性能,以评估公平性。
- 实验采用标准训练协议:SAMed训练130个周期,TransUNet训练300个周期,批量大小为42,学习率根据模型进行调优。
实验结果
研究问题
- RQ1能否构建一个大规模、多样化的医学分割数据集,以支持医学人工智能中的公平性研究?
- RQ2所提出的公平误差边界缩放(FEBS)损失是否能在不降低整体性能的前提下提升分割模型的公平性?
- RQ3在敏感属性(如种族、民族等)上,FEBS与现有公平性基线方法(如GroupDRO、ADV)相比,在公平性加权指标上的表现如何?
- RQ4FEBS在多大程度上减少了不同人口群体(如非裔、西班牙裔、亚裔和白人个体)在视盘和视杯分割任务中的性能差异?
- RQ5公平性加权指标(如ES-Dice)是否能比标准指标更有效地评估医学分割中的公平性?
主要发现
- 当种族为敏感属性时,FEBS在SAMed上实现了最高的公平性加权Dice(ES-Dice)0.8550和公平性加权IoU(ES-IoU)0.7667,优于GroupDRO和ADV。
- 在Rim分割任务中,当按种族评估时,FEBS在SAMed上实现了所有方法中最佳的ES-Dice(0.7529)和ES-IoU(0.6451),甚至超过ADV和GroupDRO。
- 对于民族属性,FEBS显著缩小了西班牙裔与非西班牙裔群体之间的性能差距,ES-Dice最高提升达0.012。
- 在所有敏感属性(包括性别和语言)上,基于FEBS的模型在ES-Dice和ES-IoU指标上均持续优于基线模型及其他公平性方法。
- 基于TransUNet的FEBS模型在公平性加权指标上优于使用ADV和GroupDRO的对应模型,表明FEBS在非SAM主干网络中同样有效。
- 语言群体的性能差异仅次于民族属性,但基于FEBS的TransUNet模型在Cup分割任务上取得了最佳公平性得分(ES-Dice: 0.7515, ES-IoU: 0.6754),展现出对语言多样性的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。