[論文レビュー] She Elicits Requirements and He Tests: Software Engineering Gender Bias in Large Language Models
本研究では、56のソフトウェア工学タスクに関連するimplicitな性別バイアスを特定するため、フィンランド語を経由したバックトランスレーション手法を用いる。その結果、テストはほぼ100%の確率で「彼(he)」と関連づけられる一方、要件の抽出はわずか6%の確率で「彼」と関連づけられることが判明し、役割に顕著な性別バイアスが存在し、社会的ステレオタイプを反映・強化していることが明らかになった。
Implicit gender bias in software development is a well-documented issue, such as the association of technical roles with men. To address this bias, it is important to understand it in more detail. This study uses data mining techniques to investigate the extent to which 56 tasks related to software development, such as assigning GitHub issues and testing, are affected by implicit gender bias embedded in large language models. We systematically translated each task from English into a genderless language and back, and investigated the pronouns associated with each task. Based on translating each task 100 times in different permutations, we identify a significant disparity in the gendered pronoun associations with different tasks. Specifically, requirements elicitation was associated with the pronoun "he" in only 6% of cases, while testing was associated with "he" in 100% of cases. Additionally, tasks related to helping others had a 91% association with "he" while the same association for tasks related to asking coworkers was only 52%. These findings reveal a clear pattern of gender bias related to software development tasks and have important implications for addressing this issue both in the training of large language models and in broader society.
研究の動機と目的
- 大規模言語モデル(LLM)におけるimplicitな性別バイアスが、特定のソフトウェア工学タスクとの関連にどのように影響するかを調査すること。
- データマイニング技術を用いて、'彼(he)' などの男性代名詞と不釣り合いに強く関連づけられる開発タスクを同定すること。
- LLMにおける性別化された言語パターンが、ソフトウェア工学の役割にステレオタイプを強化する仕組みを理解すること。
- モデルのトレーニングおよびタスク割り当てにおける標的介入の根拠を提供すること。
- 性別なし言語を用いたバックトランスレーションの有効性を示し、NLPシステムにおける微細でimplicitな性別バイアスを検出する手法の有用性を実証すること。
提案手法
- バックトランスレーション:各ソフトウェア開発タスクを英語からフィンランド語(性別を含まない言語)に翻訳し、その後DeepLを用いて再び英語に翻訳する。
- タスクリストのランダムな順列を入れ替えながら100回繰り返し実施し、翻訳における文脈依存バイアスを最小限に抑える。
- 最終的な英語文における代名詞の関連性を分析し、'he'、'she'、'he or she'、'he/she'、その他の形の出現頻度を特定する。
- 翻訳にはDeepL APIを用い、高品質な出力を活用してモデル生成テキストにおけるimplicitな性別的関連性を検出する。
- この手法は、モデルのトレーニングデータに潜在的な性別バイアスがある場合、バックトランスレーション後に一貫して'he'に翻訳されるという仮定に基づく。
- 100回の実行結果を集約することで統計的妥当性を確保し、個々の翻訳変動に起因するノイズを低減する。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルにおいて、さまざまなソフトウェア工学タスクが男性代名詞('he')とどの程度関連づけられるか。
- RQ2要件の抽出、テスト、メンタリングなどのタスクにおいて、性別代名詞の関連性はどのように変化するか。
- RQ3対人関係や協働を含むタスクは、'she' や 'he' とより強く関連づけられる可能性があるか。
- RQ4バックトランスレーション手法は、元のテキストからは見えないimplicitな性別バイアスを効果的に特定できるか。
- RQ5顧客対応や技術的自律性といったタスクの文脈が、代名詞の関連性にどのように影響するか。
主な発見
- テストはバックトランスレーションの100%において'he'と関連づけられ、この役割に男性への顕著で一貫したバイアスが存在することが示された。
- 要件の抽出はわずか6%のケースで'he'と関連づけられ、男性代名詞との関連が弱いか中立的であることを示唆している。
- 他者を支援するタスクは91%のケースで'he'と関連づけられ、支援的・協働的役割に顕著な男性バイアスが存在することが示された。
- 同僚に尋ねるタスクは52%のケースで'he'と関連づけられ、男性代名詞との関連が著しく弱いことが示された。
- コメント作成と学習は、100回のバックトランスレーションすべてで'he'と関連づけられ、認知的・知識共有的タスクに極端なバイアスが存在することが浮き彫りになった。
- 代名詞'she'は、メンタリングや会議など顧客対応や対人コミュニケーションを要するタスクとより頻繁に関連づけられており、対人的ソフトウェア工学活動における性別による役割分担が顕在化している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。