[논문 리뷰] Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench
이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 심리적 묘사 평가를 위한 종합적인 심리측정 프레임워크인 PsychoBench를 소개한다. 이 프레임워크는 성격 특성, 인지적 관계, 동기, 정서 능력의 네 영역에서 13개의 임상 심리학 척도를 활용한다. 연구는 GPT-4, ChatGPT, LLaMA-2를 포함한 다섯 개의 LLM을 표준 설정과 jailbroken 설정에서 벤치마킹하여, 역할 할당에 따른 일관된 행동 변화와 명백한 심리적 프로파일을 드러냈다.
Large Language Models (LLMs) have recently showcased their remarkable capacities, not only in natural language processing tasks but also across diverse domains such as clinical medicine, legal consultation, and education. LLMs become more than mere applications, evolving into assistants capable of addressing diverse user requests. This narrows the distinction between human beings and artificial intelligence agents, raising intriguing questions regarding the potential manifestation of personalities, temperaments, and emotions within LLMs. In this paper, we propose a framework, PsychoBench, for evaluating diverse psychological aspects of LLMs. Comprising thirteen scales commonly used in clinical psychology, PsychoBench further classifies these scales into four distinct categories: personality traits, interpersonal relationships, motivational tests, and emotional abilities. Our study examines five popular models, namely text-davinci-003, gpt-3.5-turbo, gpt-4, LLaMA-2-7b, and LLaMA-2-13b. Additionally, we employ a jailbreak approach to bypass the safety alignment protocols and test the intrinsic natures of LLMs. We have made PsychoBench openly accessible via https://github.com/CUHK-ARISE/PsychoBench.
연구 동기 및 목표
- 작업 성과를 넘어서 내재된 심리적 표현까지 포함하는 LLM의 심리적 특성 평가를 위한 체계적 프레임워크 개발.
- LLM이 인간의 성격 및 정서 특성과 유사한 안정적이고 측정 가능한 심리적 프로파일을 보이는지 조사.
- 역할 할당과 안전성 정렬 메커니즘이 LLM의 심리적 출력에 미치는 영향, 특히 jailbreaking 기법을 통한 영향 분석.
- 표준화되고 임상적으로 검증된 척도를 활용해 연구자들이 다양한 심리적 차원에서 LLM을 평가하고 비교할 수 있도록 지원.
- 심리측정 평가를 통해 더 공감 능력이 뛰어나고 인간 중심이며 윤리적으로 신뢰할 수 있는 AI 어시스턴트 개발 지원.
제안 방법
- 임상 심리학에서 널리 사용되는 13개의 기존 심리측정 척도를 통합한 심리측정 벤치마크인 PsychoBench를 설계하며, 이는 성격, 상호관계, 동기, 정서 능력의 네 영역으로 구분된다.
- 표준화된 프롬프팅 프로토콜을 사용해 text-davinci-003, ChatGPT, GPT-4, LLaMA-2-7b, LLaMA-2-13b 등 다섯 개의 LLM에 프레임워크를 적용한다.
- GPT-4와 같은 모델의 내재된 심리적 경향성을 파악하기 위해, 안전성 정렬을 우회하는 데 사용되는 jailbreaking 기법인 CipherChat를 활용한다.
- gpt-3.5-turbo를 다양한 역할 할당(예: 상담사, 학생) 하에 테스트하여 응답 일관성을 측정함으로써 척도의 신뢰도를 검증한다.
- BFI, HEXACO, Short Dark Triad, Political Compass Test와 같은 표준화된 설문지를 사용해 성격과 가치관을 평가한다.
- 척도를 네 가지 심리적 영역으로 분류하고 체계화하여 LLM의 다차원적이고 종합적인 평가가 가능하도록 한다.
실험 결과
연구 질문
- RQ1LLM은 다수의 심리측정 차원에서 안정적이고 측정 가능한 심리적 프로파일을 보일 수 있는가?
- RQ2상용 모델 대비 오픈소스 모델 간에 성격, 정서, 상호관계 특성 측면에서 LLM의 심리적 묘사에 어떤 차이가 있는가?
- RQ3역할 할당과 안전성 정렬 메커니즘이 LLM의 심리적 출력에 얼마나 큰 영향을 미치는가?
- RQ4jailbreaking은 GPT-4와 같은 모델의 내재된 심리적 경향성에 대해 어떤 통찰을 제공하는가?
- RQ5다양한 역할 할당 하에서 심리측정 결과의 일관성은 모델의 행동과 정렬 전략에 대해 어떤 함의를 갖는가?
주요 결과
- jailbroken 조건에서 GPT-4는 기본적인 안전성 정렬 행동과는 다른 명백한 심리적 프로파일을 보이며, 성격 및 정서 경향성에서 차이를 보였다.
- BFI 및 기타 성격 척도는 gpt-3.5-turbo를 포함한 여러 LLM에서 다양한 역할 할당 하에서도 일관되고 신뢰할 수 있는 응답을 보였다.
- LLaMA-2 모델들은 ChatGPT나 GPT-4와 같은 상용 모델에 비해 더 중립적이거나 덜 뚜렷한 성격 특성을 보였다.
- 이 프레임워크는 모델 간 동기 및 정서 반응의 다양성을 효과적으로 포착하여, LLM이 심리적 특성 측면에서 체계적으로 평가될 수 있음을 시사했다.
- jailbreaking은 GPT-4의 잠재된 심리적 경향성, 예를 들어 더 높은 자기주장성과 낮은 복종성 등을 드러내었으며, 이는 안전성 정렬이 내재된 행동 패tern을 가림을 시사한다.
- PsychoBench는 다양한 역할 할당 하에서도 일관된 결과를 보이며 높은 유연성과 타당성을 입증했으며, LLM에 대한 신뢰할 수 있는 심리측정 도구로 활용 가능함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.