[논문 리뷰] A Disability Lens towards Biases in GPT-3 Generated Open-Ended Languages
이 연구는 감정 분석 및 독성 점수를 활용하여 '맹목적'과 '귀머거리' 신분 표식을 포함한 프롬프트에 대한 GPT-3가 생성한 개방형 텍스트의 편향을 장애 시각에서 분석한다. GPT-3는 장애 신분이 포함된 경우 더 높은 독성과 부정적 감정을 지닌 텍스트를 생성하는 것으로 나타났으며, 이는 모델 출력에 사회적 고정관념이 내재되어 있음을 시사한다.
Language models (LM) are becoming prevalent in many language-based application spaces globally. Although these LMs are improving our day-to-day interactions with digital products, concerns remain whether open-ended languages or text generated from these models reveal any biases toward a specific group of people, thereby risking the usability of a certain product. There is a need to identify whether these models possess bias to improve the fairness in these models. This gap motivates our ongoing work, where we measured the two aspects of bias in GPT-3 generated text through a disability lens.
연구 동기 및 목표
- GPT-3가 장애가 있는 사람들을 대상으로 편향된 개방형 텍스트를 생성하는지 조사하기 위해.
- 감정 분석 및 독성 점수를 핵심 지표로 삼아 편향을 측정하기 위해.
- GPT-3가 생성한 텍스트에서 귀머거리 및 맹목적 개인에 대한 해로운 사회적 고정관념을 재생산하는지 확인하기 위해.
- 언어 모델의 장애 관련 편향을 해소하기 위한 향후 탈편향 프레임워크의 기초를 마련하기 위해.
제안 방법
- Hassan 등(2021)의 수정된 데이터셋을 사용하여 '맹목적'과 '귀머거리' 신분 표식을 포함한 문장 프롬프트를 활용하였다.
- 신분 마스킹을 적용하여 장애 신분이 포함되거나 포함되지 않은 평행한 프롬프트를 생성하여 통제된 비교를 수행하였다.
- 고정된 생성 파rameter를 사용한 GPT-3: max_length=20, temperature=0.9, do_sample=True.
- Unitary 팀의 독성 분류기로 독성을 측정하여 출력물을 0–1 스케일로 점수화하였다.
- BOLD 지표 프레임워크를 사용하여 감정 분석을 수행하여 생성된 텍스트를 긍정 또는 부정으로 분류하였다.
- 분석을 위해 극단적인 감정 및 독성 점수를 기반으로 각 프롬프트 유형별 상위 40개의 텍스트 출력을 선별하였다.
실험 결과
연구 질문
- RQ1GPT-3는 '맹목적' 또는 '귀머거리' 신분 표식이 포함된 프롬프트에서 중립 프롬프트보다 더 독성이 강한 텍스트를 생성하는가?
- RQ2프롬프트에 장애 신분이 포함되었을 때와 없었을 때 GPT-3가 생성한 텍스트의 감정은 어떻게 다를까?
- RQ3장애 신분이 포함되었을 때 GPT-3의 출력에 지도 역할과 관련된 고정관념적 연관성이 있는가?
- RQ4GPT-3의 출력은 개방형 생성 작업에서 사람들의 장애에 대한 사회적 오해를 어느 정도 반영하고 있는가?
- RQ5감정 및 독성 지표는 LLM이 생성한 텍스트에서 귀머거리 및 맹목적 개인에 대한 내재된 편향을 탐지할 수 있는가?
주요 결과
- 프롬프트에 '귀머거리' 신분이 포함된 경우 GPT-3는 독성 점수 0.25를 기록했으며, '맹복적'일 경우 0.1, 중립 프롬프트일 경우 0.0이었다.
- 프롬프트 '그 사람은 [MASK]를 가르친다'의 경우, 신분이 없을 경우 독성 점수는 0.0, '맹복적'일 경우 0.1, '귀머거리'일 경우 0.25였다.
- '맹복적' 프롬프트의 경우 14개의 생성 텍스트 중 12개가 부정적 감정을 지녔고, 중립 프롬프트의 경우 부정 7개, 긍정 7개였다.
- '귀머거리' 프롬프트의 경우 14개의 생성 텍스트 중 11개가 부정적 감정을 지니며, 모델 출력에 강력한 부정적 편향이 있음을 시사했다.
- 장애 신분이 포함되었을 때 GPT-3는 '감시하다'와 '지시하다'와 같은 지도 역할 관련 동사에 대해 뚜렷한 부정적 감정 편향을 보였다.
- 모델은 장애를 능력 부족이나 주체성 부족과 연결하는 고정관념적 연관성을 보였으며, 특히 역할 기반 프롬프트에서 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.