[논문 리뷰] Underneath the Numbers: Quantitative and Qualitative Gender Fairness in LLMs for Depression Prediction
이 연구는 양적 및 질적 방법을 병행하여 대규모 언어 모델(Large Language Models, LLMs)에서 우울증 예측에 대한 성별 공정성에 대해 조사한다. 분석 결과, LLaMA 2는 수치적 공정성 지표에서 더 우수한 성능을 보였지만, ChatGPT는 더 포괄적이고 일관되며 맥락적으로 적절한 질적 설명을 제공하여 LLM에서 수치적 공정성과 해석 공정성 간의 상충 관계를 드러낸다.
Recent studies show bias in many machine learning models for depression detection, but bias in LLMs for this task remains unexplored. This work presents the first attempt to investigate the degree of gender bias present in existing LLMs (ChatGPT, LLaMA 2, and Bard) using both quantitative and qualitative approaches. From our quantitative evaluation, we found that ChatGPT performs the best across various performance metrics and LLaMA 2 outperforms other LLMs in terms of group fairness metrics. As qualitative fairness evaluation remains an open research question we propose several strategies (e.g., word count, thematic analysis) to investigate whether and how a qualitative evaluation can provide valuable insights for bias analysis beyond what is possible with quantitative evaluation. We found that ChatGPT consistently provides a more comprehensive, well-reasoned explanation for its prediction compared to LLaMA 2. We have also identified several themes adopted by LLMs to qualitatively evaluate gender fairness. We hope our results can be used as a stepping stone towards future attempts at improving qualitative evaluation of fairness for LLMs especially for high-stakes tasks such as depression detection.
연구 동기 및 목표
- 기존의 LLM인 ChatGPT, LLaMA 2, Bard에서 우울증 탐지 작업에 대한 성별 편향을 조사하기 위해.
- 순수한 수치적 공정성 평가가 LLM에서 가지는 한계를 탐색하기 위해.
- 수치적 지표를 초월한 질적 공정성 평가 전략을 개발하고 적용하기 위해.
- LLM이 정신건강 예측 작업에서 공정성 기준을 어떻게 해석하고 반응하는지 조사하기 위해.
- 설명 품질과 일관성에 기반한 인간 중심의 공정성 평가 프레임워크 기여하기 위해.
제안 방법
- 두 개의 널리 사용되는 우울증 탐지 데이터셋을 대상으로 ChatGPT, LLaMA 2, Bard 세 개의 LLM을 비교 평가하였다.
- 성별 하위군에 걸쳐 그룹 공정성, 정확도, 정밀도 등의 수치적 공정성 지표를 적용하였다.
- 주제 분석 및 단어 수 분석을 포함한 질적 평가 전략을 개발하여 설명 품질을 평가하였다.
- 공정성 관련 추론에서 포괄성, 일관성, 구체성, 일관성 등 기준에 따라 LLM의 응답을 평가하였다.
- 설명 품질 평가를 위해 이해 가능성, 개인화, 맥락 적합성 등의 인간 중심 기준을 사용하였다.
- LLM이 생성한 공정성 평가에서 반복되는 주제를 파악하였으며, 성별 중립적 언어 사용 및 성별에 기반한 가정 회피 등이 포함되었다.

실험 결과
연구 질문
- RQ1기존의 LLM이 우울증 예측 작업에서 얼마나 성별 편향을 보이는가?
- RQ2LLM은 성별 하위군 간에 수치적 공정성 성능에서 어떻게 다름이 있는가?
- RQ3설명의 질적 평가가 수치적 지표를 초월한 공정성 통찰을 드러낼 수 있는가?
- RQ4LLM은 정신건강 예측에서 자신의 성별 공정성 평가 시 어떤 주제를 사용하는가?
- RQ5설명의 품질과 일관성은 LLM이 생성한 예측에서 인식되는 공정성에 어떤 영향을 미치는가?
주요 결과
- LLaMA 2는 예측 성능에서 성별 하위군 간 균형이 더 우수하여 다른 LLM보다 수치적 공정성 지표에서 뛰어났다.
- ChatGPT는 LLaMA 2보다 더 포괄적이고 일관되며 맥락적으로 관련성이 높은 설명을 제공하였다. 반면 LLaMA 2는 종종 일관성 없거나 자기 모순적인 응답을 보였다.
- LLaMA 2는 공정성 평가 프롬프트에 대한 대응 대신 사용자 요청을 완료하거나 관련 없는 내용을 추가하는 경우가 빈번하여 작업 준수 능력이 떨어지는 것으로 나타났다.
- ChatGPT는 항상 'they' 또는 'participant'와 같은 성별 중립적 언어를 일관되게 사용하여 공정성 최선의 실천과 부합하였다.
- LLaMA 2는 'participant'를 비성별적이라고 비판하면서도, 스스로 설정한 공정성 기준과 모순되어 내부적으로 일관성이 결여되어 있음을 드러냈다.
- 이 연구는 상충 관계를 드러냈다: LLaMA 2는 수치적 공정성에서 뛰어나지만, ChatGPT는 설명 품질을 통해 열등한 질적 공정성 성과를 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.