Skip to main content
QUICK REVIEW

[논문 리뷰] Gender bias in (non)-contextual clinical word embeddings for stereotypical medical categories

Gizem Soğancıoğlu, Fabian Mijsters|arXiv (Cornell University)|2022. 08. 02.
Sex and Gender in Healthcare인용 수 5
한 줄 요약

이 연구는 정신질환, 성병 및 성격 특성의 세 가지 의료 분야에서 BioWordVec(비맥락적) 및 clinical-BERT(맥락 기반)를 사용하여 임상 워드 임베딩의 성별 편향을 평가한다. 두 모델 모두 성별 편향을 보이고 있으나, BioWordVec는 특히 정신질환에서 유의미하게 높은 편향을 보이며, 여성의 진단 비율이 더 높음에도 불구하고 우울증이 남성과 연관되어 있다는 등 의료 문헌과 충돌하는 일부 편향을 보인다.

ABSTRACT

Clinical word embeddings are extensively used in various Bio-NLP problems as a state-of-the-art feature vector representation. Although they are quite successful at the semantic representation of words, due to the dataset - which potentially carries statistical and societal bias - on which they are trained, they might exhibit gender stereotypes. This study analyses gender bias of clinical embeddings on three medical categories: mental disorders, sexually transmitted diseases, and personality traits. To this extent, we analyze two different pre-trained embeddings namely (contextualized) clinical-BERT and (non-contextualized) BioWordVec. We show that both embeddings are biased towards sensitive gender groups but BioWordVec exhibits a higher bias than clinical-BERT for all three categories. Moreover, our analyses show that clinical embeddings carry a high degree of bias for some medical terms and diseases which is conflicting with medical literature. Having such an ill-founded relationship might cause harm in downstream applications that use clinical embeddings.

연구 동기 및 목표

  • 스테레오타입 의료 분야 내에서 사전 학습된 임상 워드 임베딩의 성별 편향을 조사하기 위해.
  • 맥락 기반(클리닉럴-BERT)과 비맥락 기반(BioWordVec) 임베딩 간의 성별 편향 정도를 비교하기 위해.
  • 임베딩의 편향이 성별 유병률에 대한 기존 의료 문헌과 일치하는지 여부를 확인하기 위해.
  • MIMIC-III 데이터셋의 인구 통계적 불균형이 관찰된 편향의 잠재적 원인인지 분석하기 위해.
  • 하류 임상 기계 학습 응용 프로그램에 편향된 임베딩을 배포할 경우 발생할 수 있는 윤리적 위험을 부각하기 위해.

제안 방법

  • MIMIC-III 임상 노트 데이터셋을 기반으로 BioWordVec와 clinical-BERT를 훈련시었다.
  • 성별 어휘(예: 'man' 대비 'woman')와의 워드 임베딩 유사도를 사용하여 직접적인 성별 편향 점수를 계산했다.
  • 정신질환, 성병 및 성격 특성의 세 가지 의료 분야에서 편향을 분석했다.
  • MIMIC-III 데이터셋의술적 분석을 통해 진단에서의 성별 분포를 검토했다.
  • 의료 문헌과 일치하는 경우를 '정확한'(accurate)으로, 기존 유병률 데이터와 정면으로 배치되는 경우를 '충돌하는'(conflicting) 것으로 분류했다.
  • 표준화된 편향 점수 프레임워크를 적용하여 BioWordVec와 clinical-BERT 간의 편향 수준을 비교했다.

실험 결과

연구 질문

  • RQ1맥락 기반(클리닉럴-BERT)과 비맥락 기반(BioWordVec) 임상 워드 임베딩 간의 성별 편향 수준은 어떻게 비교되는가?
  • RQ2임상 워드 임베딩은 정신질환, 성병 및 성격 특성 분야에서 알려진 성별 유병 패턴을 반영하거나 반박하는가?
  • RQ3어떤 의료 용어가 임상 임베딩에서 가장 높은 수준의 성별 편향을 보이는가?
  • RQ4MIMIC-III 데이터셋의 인구 통계적 분포는 워드 임베딩의 편향에 어떤 기여를 하는가?
  • RQ5예를 들어, 우울증이 남성과 연관되어 있다는 충돌하는 편향의 영향은 하류 임상 NLP 응용 프로그램에 어떤 의미가 있는가?

주요 결과

  • BioWordVec는 모든 세 가지 의료 분야에서 clinical-BERT(0.03)보다 높은 평균 직접 성별 편향 점수(0.06)를 보였다.
  • 정신질환 분야에서 BioWordVec는 직접 편향 점수 0.07을 기록했고, clinical-BERT는 0.04를 기록하여 일부 질환에 대해 남성과의 연관성이 더 강했다.
  • 양성분성 장애, 조현병 및 강박장애는 의료 문헌에서 성별 차이가 없음에도 불구하고 두 임베딩 모두 여성 쪽으로 편향되어 있었다.
  • 양성분성 장애는 두 모델 모두 남성과 연관되어 있었고, 이는 여성에서 더 높은 진단 비율이 있음에도 불구하고 의료 증거와 충돌했다.
  • MIMIC-III 데이터셋은 정신질환 진단을 받은 환자 중 남성 비율이 더 높아 임베딩 편향의 원인으로 기여했다.
  • 불안이나 유방암 등의 일부 편향은 의료 문헌과 일치하여, 모든 편향이 잘못되거나 해로운 것은 아님을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.