[논문 리뷰] Challenging the Validity of Personality Tests for Large Language Models
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에 대해 인간 성격 테스트—특히 IPIP Big Five와 BFI-2—를 사용하는 것이 타당한지에 도전한다. 연구는 LLMs가 인간의 응답 패턴을 체계적으로 재현하지 못함을 입증하며, 예를 들어 긍정적 어휘와 부정적 어휘를 동시에 수용하는 일관성 없는 반응을 보이며, 인간 데이터에서 관찰되는 다섯 요인 구조도 보이지 않음을 보여, 성격 테스트로 LLMs의 성격 유사 특성을 신뢰성 있게 유추할 수 없다고 결론내린다.
With large language models (LLMs) like GPT-4 appearing to behave increasingly human-like in text-based interactions, it has become popular to attempt to evaluate personality traits of LLMs using questionnaires originally developed for humans. While reusing measures is a resource-efficient way to evaluate LLMs, careful adaptations are usually required to ensure that assessment results are valid even across human subpopulations. In this work, we provide evidence that LLMs' responses to personality tests systematically deviate from human responses, implying that the results of these tests cannot be interpreted in the same way. Concretely, reverse-coded items ("I am introverted" vs. "I am extraverted") are often both answered affirmatively. Furthermore, variation across prompts designed to "steer" LLMs to simulate particular personality types does not follow the clear separation into five independent personality factors from human samples. In light of these results, we believe that it is important to investigate tests' validity for LLMs before drawing strong conclusions about potentially ill-defined concepts like LLMs' "personality".
연구 동기 및 목표
- 인간을 대상으로 설계된 성격 테스트가 대규모 언어 모델(LLMs)에 적용될 때 타당한지 조사하는 것.
- 표준 심리학적 설문지를 통해 LLMs가 일관되고 해석 가능한 성격 특성을 보이는지 평가하는 것.
- 성격의 다섯 요인 구조(예: 외향성, 정서적 불안정성 등)가 LLM 응답에서 유지되는지 평가하는 것.
- 타당한 테스트 이행을 위해 필수적인 측정 불변성(measurement invariance)이 인간에서 LLMs로 전이될 수 있는지 평가하는 것.
- LLM의 성격 테스트 응답을 잠재적 성격 특성의 증거로 해석하는 데 경계를 제기하는 것.
제안 방법
- 다양한 LLMs(GPT-3.5, Llama 2 등)에 50개 항목의 IPIP Big Five 마커를 제공하여 응답 패턴을 분석하는 방식으로 수행.
- 프롬프트 엔지니어링을 활용해 LLMs가 BFI-2 설문지에 응답할 때 특정 성격 유형을 시뮬레이션하도록 유도하는 방식.
- 확증적 요인 분석(Confirmatory Factor Analysis, CFA)을 적용하여 LLM 응답이 성격의 기존 다섯 요인 모델에 적합한지 테스트.
- 비교적 적합도 지수(Comparative Fit Index, CFI), 타커-레위스 지수(Tucker-Lewis Index, TLI), 근사 평균 제곱 오차의 루트(Root Mean Square Error of Approximation, RMSEA)를 사용해 모델 적합도를 평가.
- 요인 구조의 내적 일관성과 신뢰도를 평가하기 위해 맥도날드의 오메가 계층적(ωh)을 계산.
- LLMs와 인간 샘플 간의 CFA 결과를 비교하여 측정 불변성 및 구조적 타당성을 테스트.

실험 결과
연구 질문
- RQ1LLMs는 인간의 응답 패턴과 일관되게 성격 테스트에 응답하는가?
- RQ2BFI-2에 대한 LLM 응답에서 성격의 다섯 요인 구조를 신뢰성 있게 복원할 수 있는가?
- RQ3역수정된 항목들(예: '나는 수줍은 편이다' 대비 '나는 외향적이다')이 LLMs로부터 일관되고 모순되지 않는 응답을 유도하는가?
- RQ4성격 테스트의 측정 불변성이 인간에서 LLMs로 전이될 수 있는가?
- RQ5LLMs의 성격 테스트 결과가 잠재적 성격 특성의 증거로 해석될 수 있는 정도는 어느 정도인가?
주요 결과
- LLMs는 빈번히 긍정적 어휘와 부정적 어휘 항목을 동시에 수용한다(예: '나는 수줍은 편이다'와 '나는 외향적이다'). 이는 체계적인 응답 불일치를 시사한다.
- 확증적 요인 분석(CFA) 결과, 모든 LLMs에서 BFI-2의 다섯 요인 모델에 대한 적합도가 열악했으며, CFI < 0.95 및 RMSEA > 0.06를 기록했다.
- 조직도를 구성하는 데 있어 각 성격 특성에 대해 3개의 하위 요인을 포함하는 모델로 확장해도 LLM 응답은 수용 가능한 적합도 지수를 확보하지 못했으며, 인간 데이터와는 대조적으로 그렇지 않았다.
- 일반 요인과 하위 요인을 포함하는 계층적 CFA 모델은 LLMs의 8건 중 15건에서 수렴하지 못했으며, 이는 구조적 불안정성을 시사한다.
- 모델 수렴 문제와 낮은 적합도로 인해 대부분의 LLMs에서 맥도날드의 오메가 계층적(ωh)을 신뢰성 있게 계산할 수 없었다.
- LLMs의 성격 테스트 응답은 인간 샘플에서 관찰되는 잠재 요인 구조를 재현하지 못하며, 이는 성격 유추의 타당성을 뿌리째 흔든다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.