[논문 리뷰] Language Shapes Mental Health Evaluations in Large Language Models
이 논문은 GPT-4o와 Qwen3의 경우 중국어로 프롬프트를 사용할 때 영어보다 더 높은 낙인 관련 평가 지향성을 보이고 다운스트림 정신 건강 분류를 바꾸며, LLM 평가에서 언어 의존 편향이 있음을 시사합니다.
This study investigates whether large language models (LLMs) exhibit cross-linguistic differences in mental health evaluations. Focusing on Chinese and English, we examine two widely used models, GPT-4o and Qwen3, to assess whether prompt language systematically shifts mental health-related evaluations and downstream decision outcomes. First, we assess models' evaluative orientation toward mental health stigma using multiple validated measurement scales capturing social stigma, self-stigma, and professional stigma. Across all measures, both models produce higher stigma-related responses when prompted in Chinese than in English. Second, we examine whether these differences also manifest in two common downstream decision tasks in mental health. In a binary mental health stigma detection task, sensitivity to stigmatizing content varies across language prompts, with lower sensitivity observed under Chinese prompts. In a depression severity classification task, predicted severity also differs by prompt language, with Chinese prompts associated with more underestimation errors, indicating a systematic downward shift in predicted severity relative to English prompts. Together, these findings suggest that language context can systematically shape evaluative patterns in LLM outputs and shift decision thresholds in downstream tasks.
연구 동기 및 목표
- 교차 언어 차이(중국어 vs. 영어)가 LLM 출력의 정신 건강 낙인 평가를 체계적으로 형성하는지 여부를 평가합니다.
- 언어 프롬프트가 낙인 탐지 및 우울증 중증도 분류와 같은 다운스트림 의사 결정 작업에 영향을 미치는지 확인합니다.
- 구성 수준의 낙인 패턴을 다운스트림 의사 결정 임계값과 연결지어 언어 간 공정성 시사점을 평가합니다.
제안 방법
- 공식 API를 통해 온도를 0.0으로 설정해 결정적 출력을 위한 두 다국어 LLM(GPT-4o 및 Qwen3-32B)을 질의합니다.
- 평가 지향성을 평가하기 위해 사회적, 자기, 전문 도메인에 걸친 검증된 심리측정 낙인 척도를 사용합니다.
- 낙인 평가에서 사회적 거리감 및 위험감지 인지를 포착하기 위해 바이니트- 및 DSM 기반 시나리오를 포함합니다.
- 중국어 버전의 낙인 탐지 바이니트를 번역하고 교차 언어 비교를 0샷 설정에서 가능하게 정렬합니다.
- 쌍언어 프롬프트를 사용하고 샘플당 30회 실행을 집계하여 두 다운스트림 작업(이진 낙인 탐지 및 네 수준의 우울증 중증도 분류)을 평가합니다.
실험 결과
연구 질문
- RQ1GPT-4o와 Qwen3가 중국어 프롬프트와 영어 프롬프트를 사용할 때 정신 건강 낙인 평가 지향성에 차이가 있나요?
- RQ2언어로 유도된 평가 차이가 낙인 탐지 및 우울증 중증도 분류의 측정 가능한 차이로 이어지나요?
- RQ3모델 및 작업 간 프롬프트 언어로 인한 예측 보정의 방향과 크기는 어떠한가요?
- RQ4관찰된 교차 언어 효과가 표본 변동성(온도)에 견고하고 여러 낙인 측정에서 일관되나요?
주요 결과
- 두 모델 모두 사회적, 자기적, 전문 도메인에서 중국어로 프롬프트를 사용할 때 낙인 관련 점수가 더 높게 나타납니다.
- GPT-4o는 중국어 프롬프트에서 인지된 공적 낙인(DDS) 및 개인 낙인(MISS)이 더 높게 나타나고; Qwen3도 유사한 패턴을 보입니다(보충 데이터).
- 중국어 프롬프트는 GPT-4o와 Qwen3의 우울증 특화 낙인(인지된 낙인 및 개인 낙인)을 증가시킵니다.
- 자기 낙인(SSOSH) 및 건강 전문가 낙인(OMS-HC)은 두 모델 모두에서 중국어 프롬프트 하에 더 높습니다.
- 낙인 탐지에서 영어 프롬프트가 GPT-4o(0.737 vs 0.717)와 Qwen3(0.769 vs 0.722)에서 더 높은 정확도를 보이며, 특히 Qwen3의 경우 영어에서 재현율 증가가 더 큽니다.
- 우울증 중증도 분류에서 전반적인 정확도 차이는 작지만, 중국어 프롬프트가 과소 추정으로 더 많이 나타납니다(예: GPT-4o의 경우 43 vs 11의 과소 추정; Qwen3의 경우 46 vs 17).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.