Skip to main content
QUICK REVIEW

[논문 리뷰] FairSeg: A Large-Scale Medical Image Segmentation Dataset for Fairness Learning Using Segment Anything Model with Fair Error-Bound Scaling

Yu‐Shi Tian, Min Shi|arXiv (Cornell University)|2023. 11. 03.
Climate Change and Health Impacts인용 수 5
한 줄 요약

이 논문은 10,000개의 망막 영상과 망막 중심 및 컵 영역에 대한 애너테이션을 포함한, 공정성 학습을 위한 최초의 대규모 의료 영상 분할 데이터셋인 Harvard-FairSeg를 소개한다. Segment Anything Model(SAM) 및 TransUNet 백본을 사용한 분할 모델에서 공정성을 향상시키기 위해, 개별 신분 그룹의 오차 상한을 기반으로 손실 함수를 재가중하는 fair error-bound scaling (FEBS) 손실을 제안한다. FEBS는 인종, 민족, 성별, 언어 그룹 전반에서 최신 기술 수준의 공정성 스케일링된 Dice 점수를 달성한다.

ABSTRACT

Fairness in artificial intelligence models has gained significantly more attention in recent years, especially in the area of medicine, as fairness in medical models is critical to people's well-being and lives. High-quality medical fairness datasets are needed to promote fairness learning research. Existing medical fairness datasets are all for classification tasks, and no fairness datasets are available for medical segmentation, while medical segmentation is an equally important clinical task as classifications, which can provide detailed spatial information on organ abnormalities ready to be assessed by clinicians. In this paper, we propose the first fairness dataset for medical segmentation named Harvard-FairSeg with 10,000 subject samples. In addition, we propose a fair error-bound scaling approach to reweight the loss function with the upper error-bound in each identity group, using the segment anything model (SAM). We anticipate that the segmentation performance equity can be improved by explicitly tackling the hard cases with high training errors in each identity group. To facilitate fair comparisons, we utilize a novel equity-scaled segmentation performance metric to compare segmentation metrics in the context of fairness, such as the equity-scaled Dice coefficient. Through comprehensive experiments, we demonstrate that our fair error-bound scaling approach either has superior or comparable fairness performance to the state-of-the-art fairness learning models. The dataset and code are publicly accessible via https://ophai.hms.harvard.edu/datasets/harvard-fairseg10k.

연구 동기 및 목표

  • 의료 분할 분야에서 공정성 평가 및 편향 제거를 위해 특별히 설계된 대규모 공개 데이터셋이 부족한 문제를 해결하기 위해.
  • 성능이 열악한 민족적 배경 그룹에서의 어려운 케이스에 초점을 맞춰, 훈련 과정에서 하한 오차를 기반으로 손실 함수를 재가중하는 새로운 공정성 인식 손실 함수인 fair error-bound scaling (FEBS)을 개발하기 위해.
  • 민감한 속성에 따라 분할 성능를 공정하게 비교하기 위해, 공정성 스케일링된 지표(예: 공정성 스케일링된 Dice 계수)를 도입하기 위해.
  • 의료 분할 작업에서 다양한 민족적 배경 그룹—인종, 민족, 성별, 언어—에 대해 공정성 성능을 벤치마킹하기 위해.
  • FEBS가 전체 성능을 희생시키지 않고도, 특히 黑人 및 히스패닉계와 같은 소수자원 그룹의 공정성을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • Harvard-FairSeg 데이터셋은 망막 중심 및 컵에 대한 픽셀 단위 애너테이션을 포함한 10,000개의 SLO 망막 영상으로 구성되며, 인종, 민족, 성별, 언어 등의 다양한 민감한 속성을 포함하도록 구성되었다.
  • 제안된 fair error-bound scaling (FEBS) 손실은 각 신분 그룹의 오차 상한을 기반으로 교차 엔트로피 손실을 동적으로 재가중하여, 성능이 열악한 그룹의 어려운 학습 샘플에 우선순위를 둔다.
  • FEBS는 각 그룹의 최대 훈련 오차 기여도를 균형 있게 조절하기 위해 γ-가중 스케일링 인자(실험에서 1.0으로 설정)를 사용한다.
  • 이 방법은 SAMed(튜닝된 SAM) 및 TransUNet 두 가지 분할 백본을 사용하여 아키텍처 간 비교가 가능하도록 적용되었다.
  • 표준 성능 평가 기준 외에 민감한 속성 간 성능의 공정성에 초점을 맞춘 새로운 공정성 스케일링 지표(예: ES-Dice)를 도입하였다.
  • 실험은 표준 훈련 프로토콜을 사용하였으며, SAMed의 경우 130 에포크, TransUNet의 경우 300 에포크, 배치 크기 42, 모델 별로 최적화된 학습률을 적용하였다.

실험 결과

연구 질문

  • RQ1의료 AI 분야의 공정성 연구를 지원하기 위해, 다각도의 다양성을 포함한 대규모이고 다양한 의료 분할 데이터셋을 구축할 수 있는가?
  • RQ2제안된 fair error-bound scaling (FEBS) 손실이 전체 성능을 저하시키지 않고도 분할 모델의 공정성을 향상시키는가?
  • RQ3민감한 속성에 따라 공정성 스케일링 지표에서 FEBS는 GroupDRO, ADV와 같은 기존 공정성 기반 방법과 비교해 어떻게 성과를 내는가?
  • RQ4FEBS는 망막 중심 및 컵 분할 과제에서 黑인, 히스패닉계, 아시아계, 백인과 같은 민족적 배경 그룹 간의 성능 격차를 어느 정도 감소시키는가?
  • RQ5표준 지표보다 공정성 스케일링 지표(예: ES-Dice)가 의료 분할에서 공정성 평가에 더 의미 있는가?

주요 결과

  • 민감한 속성으로 인종을 사용한 경우, SAMed를 사용한 Cup 분할 과제에서 FEBS는 ES-Dice 0.8550과 ES-IoU 0.7667을 기록하여 GroupDRO 및 ADV를 모두 초월하였다.
  • Rim 분할 과제에서, 인종을 민감한 속성으로 삼아 평가한 결과, FEBS는 SAMed를 사용해 모든 방법 중에서 가장 높은 ES-Dice(0.7529)와 ES-IoU(0.6451)를 달성하였으며, ADV 및 GroupDRO를 모두 능가하였다.
  • 민족적 배경에 따라, FEBS는 히스패닉계와 비히스패닉계 그룹 간의 성능 격차를 크게 줄였으며, 기준 모델 대비 ES-Dice 개선 폭이 최대 0.012에 이르렀다.
  • 성별 및 언어를 포함한 모든 민감한 속성에 대해 FEBS 기반 모델은 ES-Dice 및 ES-IoU 측면에서 기준 모델 및 다른 공정성 방법보다 일관되게 뛰어난 성능을 보였다.
  • TransUNet 기반 모델에서 FEBS를 적용한 결과, ADV 및 GroupDRO 대비 더 높은 공정성 스케일링 지표를 확보하여, FEBS가 SAM 이외의 백본에서도 효과적임을 입증하였다.
  • 언어 그룹은 인종에 이어 성능 격차가 두 번째로 큰 그룹이었지만, FEBS 기반 TransUNet 모델은 Cup 분할 과제에서 최고의 공정성 스코어(ES-Dice: 0.7515, ES-IoU: 0.6754)를 기록하여 언어 다양성에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.