Skip to main content
QUICK REVIEW

[論文レビュー] Gender bias in (non)-contextual clinical word embeddings for stereotypical medical categories

Gizem Soğancıoğlu, Fabian Mijsters|arXiv (Cornell University)|Aug 2, 2022
Sex and Gender in Healthcare被引用数 5
ひとこと要約

本研究では、精神疾患、性伝染疾患、性格特性の3つの医学的分野において、非文脈的であるBioWordVecと文脈化されたclinical-BERTを用いて、臨床用語埋め込みにおける性別バイアスを評価する。両モデルとも性別バイアスを示すが、特に精神疾患において、BioWordVecのバイアスが顕著に高く、女性の診断率がより高いにもかかわらず抑うつが男性と関連づけられるなど、医学文献と矛盾するバイアスが見られる。

ABSTRACT

Clinical word embeddings are extensively used in various Bio-NLP problems as a state-of-the-art feature vector representation. Although they are quite successful at the semantic representation of words, due to the dataset - which potentially carries statistical and societal bias - on which they are trained, they might exhibit gender stereotypes. This study analyses gender bias of clinical embeddings on three medical categories: mental disorders, sexually transmitted diseases, and personality traits. To this extent, we analyze two different pre-trained embeddings namely (contextualized) clinical-BERT and (non-contextualized) BioWordVec. We show that both embeddings are biased towards sensitive gender groups but BioWordVec exhibits a higher bias than clinical-BERT for all three categories. Moreover, our analyses show that clinical embeddings carry a high degree of bias for some medical terms and diseases which is conflicting with medical literature. Having such an ill-founded relationship might cause harm in downstream applications that use clinical embeddings.

研究の動機と目的

  • ステレオタイプな医学的分野における事前学習済み臨床用語埋め込みの性別バイアスを調査すること。
  • 文脈化された(clinical-BERT)と非文脈化された(BioWordVec)埋め込みの間で、性別バイアスの程度を比較すること。
  • 埋め込み内のバイアスが、性別頻度に関する既存の医学文献と一致するか、あるいは矛盾するかを特定すること。
  • MIMIC-IIIデータセットにおける人種的・性別の不均衡が、観察されたバイアスの原因である可能性を検討すること。
  • 下流の臨床機械学習アプリケーションへのバイアス付き埋め込みの導入に伴う倫理的リスクを強調すること。

提案手法

  • MIMIC-III臨床ノートデータセット上でBioWordVecおよびclinical-BERTを訓練した。
  • 「男」と「女」などの性別語との類似度を用いて、直接的性別バイアススコアを算出した。
  • 精神疾患、性伝染疾患、性格特性という3つの医学的分野におけるバイアスを分析した。
  • MIMIC-IIIデータセットの記述的分析を用いて、診断における性別の分布を検証した。
  • 医学文献と一致する場合を「正確」とし、既存の頻度データと矛盾する場合を「矛盾」と分類した。
  • 標準化されたバイアススコアフレームワークを適用し、BioWordVecとclinical-BERT間のバイアスレベルを比較した。

実験結果

リサーチクエスチョン

  • RQ1文脈化された(clinical-BERT)と非文脈化された(BioWordVec)臨床用語埋め込みの間で、性別バイアスの程度はどのように異なるか?
  • RQ2臨床用語埋め込みは、精神疾患、性伝染疾患、性格特性における既知の性別頻度パターンをどの程度反映しているか、あるいは矛盾しているか?
  • RQ3どの医学用語が臨床埋め込みにおいて最も高い性別バイアスを示しているか?
  • RQ4MIMIC-IIIデータセットの人口統計的分布は、用語埋め込みのバイアスにどのように寄与しているか?
  • RQ5抑うつが男性と関連づけられるなどの矛盾するバイアスの影響は、下流の臨床NLPアプリケーションにどのような意味を持つのか?

主な発見

  • すべての3つの医学的分野において、BioWordVecの平均直接的性別バイアススコア(0.06)は、clinical-BERTのスコア(0.03)よりも高い。
  • 精神疾患においては、BioWordVecの直接的バイアススコアは0.07、clinical-BERTは0.04であり、一部の疾患が男性と強く関連していることが示された。
  • 双極性障害、統合失調症、強迫性障害は、医学文献に明確な性別差がないにもかかわらず、両埋め込みで女性寄りのバイアスを示している。
  • 抑うつは両モデルで男性寄りのバイアスを示しており、女性の診断率がより高い臨床的証拠と矛盾している。
  • MIMIC-IIIデータセットでは、精神疾患の診断を受けた患者のうち男性の割合が高く、これが埋め込みバイアスの原因となっている。
  • 「不安」と「乳がん」の一部のバイアスは医学文献と一致しており、すべてのバイアスが誤りまたは有害であるとは限らないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。