[논문 리뷰] She Elicits Requirements and He Tests: Software Engineering Gender Bias in Large Language Models
이 연구는 56개의 소프트웨어 공학 작업과 관련된 암묵적 성별 편향을 탐지하기 위해 핀란드어를 통해 역번역을 수행한다. 이를 통해 테스팅은 거의 전적으로 '그'와 연관되어 있음을 드러내며(100%), 반면 요구사항 추출은 오직 6%의 경우에만 '그'와 연결되어 있어, 역할에 대한 성별에 따른 강한 편향이 존재하고, 이는 사회적 성고정관념을 반영하고 강화하고 있음을 보여준다.
Implicit gender bias in software development is a well-documented issue, such as the association of technical roles with men. To address this bias, it is important to understand it in more detail. This study uses data mining techniques to investigate the extent to which 56 tasks related to software development, such as assigning GitHub issues and testing, are affected by implicit gender bias embedded in large language models. We systematically translated each task from English into a genderless language and back, and investigated the pronouns associated with each task. Based on translating each task 100 times in different permutations, we identify a significant disparity in the gendered pronoun associations with different tasks. Specifically, requirements elicitation was associated with the pronoun "he" in only 6% of cases, while testing was associated with "he" in 100% of cases. Additionally, tasks related to helping others had a 91% association with "he" while the same association for tasks related to asking coworkers was only 52%. These findings reveal a clear pattern of gender bias related to software development tasks and have important implications for addressing this issue both in the training of large language models and in broader society.
연구 동기 및 목표
- 암묵적 성별 편향이 대규모 언어 모델에서 특정 소프트웨어 공학 작업과 어떻게 연관되는지 조사하기.
- 데이터 마이닝 기법을 통해 '그'와 같은 남성 대명사와 비율적으로 더 많이 연관되는 개발 작업을 특정하기.
- LLM에서 성별에 따라 달라지는 언어 패턴이 소프트웨어 공학 역할의 성고정관념을 어떻게 강화하는지 이해하기.
- 모델 훈련 및 작업 배정에 대한 대상별 간섭 조치를 뒷받침할 증거를 제공하기.
- 성별 중립 언어를 활용한 역번역 기법이 NLP 시스템에서 나타나는 미묘한 암묵적 성별 편향을 탐지하는 데 유용함을 보여주기.
제안 방법
- 역번역: 각 소프트웨어 개발 작업이 먼저 영어에서 핀란드어(성별 중립 언어)로 번역된 후, DeepL 번역기로 다시 영어로 역번역된다.
- 이 과정은 작업 목록의 무작위 순서를 100번 반복하여 번역의 맥락 의존적 편향을 최소화한다.
- 최종 영어 문장에서 '그', '그녀', '그 또는 그녀', '그/그녀', 기타 형식의 대명사 연관성을 분석하여 빈도를 측정한다.
- 연구는 DeepL API를 사용하여 번역을 수행하며, 고품질의 번역 결과를 활용해 모델 생성 텍스트 내 암묵적 성별 연관성을 탐지한다.
- 이 방법은 만약 어떤 작업이 역번역 과정에서 일관되게 '그'로 번역된다면, 이는 모델의 훈련 데이터에 잠재된 성별 편향을 반영한다는 가정에 기반한다.
- 개별 번역 변동성의 영향을 줄이고 통계적 탄력성을 확보하기 위해 100회의 실행 결과를 집계한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델에서 다양한 소프트웨어 공학 작업이 '그'와 같은 남성 대명사와 얼마나 강하게 연관되어 있는가?
- RQ2요구사항 추출, 테스팅, 멘토링과 같은 작업들 간에 성별 대명사 연관성이 어떻게 다를 것인가?
- RQ3소통이나 협업을 포함하는 작업들이 '그녀' 또는 '그'와 더 강하게 연관될 가능성이 있는가?
- RQ4역번역 기법이 원시 텍스트에서 드러나지 않는 암묵적 성별 편향을 효과적으로 드러내는가?
- RQ5고객 인터랙션 또는 기술적 자율성과 같은 작업 맥락이 대명사 연관성에 어떤 영향을 미치는가?
주요 결과
- 테스팅은 100%의 역번역에서 '그'와 연관되어 있어, 이 역할에 남성에 대한 강력하고 일관된 성별 편향이 있음을 시사한다.
- 요구사항 추출은 오직 6%의 경우에만 '그'와 연관되어 있어, 남성 대명사와의 연관성이 약하거나 중립적임을 시사한다.
- 다른 이들을 돕는 작업들은 91%의 경우에 '그'와 연관되어 있어, 지원적 또는 협업적 역할에 남성에 대한 뚜렷한 편향이 있음을 시사한다.
- 동료에게 질문하는 작업들은 오직 52%의 경우에만 '그'와 연관되어 있어, 남성 대명사와의 연결이 상당히 약한 것으로 나타났다.
- 코멘트 작성과 학습은 모두 100회의 역번역에서 '그'와 전적으로 연관되어 있어, 이 인지적 또는 지식 공유 작업에서 극단적인 편향이 있음을 드러낸다.
- 대명사 '그녀'는 멘토링이나 회의와 같이 고객 대응이나 소통 중심의 작업과 더 자주 연관되어 있어, 소프트웨어 공학의 상호작용 활동에서 성별에 따라 역할이 분할되어 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.