[논문 리뷰] Is ChatGPT a Good Personality Recognizer? A Preliminary Study
본 논문은 다양한 프롬팅 전략을 사용하여 텍스트에서 ChatGPT가 빅파이브 성격 특성을 인식하는 능력을 평가하고, 기준 모델 및 SOTA 모델과의 비교, 공정성 분석 및 하류 작업에 대한 영향까지 살펴본다.
In recent years, personality has been regarded as a valuable personal factor being incorporated into numerous tasks such as sentiment analysis and product recommendation. This has led to widespread attention to text-based personality recognition task, which aims to identify an individual's personality based on given text. Considering that ChatGPT has recently exhibited remarkable abilities on various natural language processing tasks, we provide a preliminary evaluation of ChatGPT on text-based personality recognition task for generating effective personality data. Concretely, we employ a variety of prompting strategies to explore ChatGPT's ability in recognizing personality from given text, especially the level-oriented prompting strategy we designed for guiding ChatGPT in analyzing given text at a specified level. The experimental results on two representative real-world datasets reveal that ChatGPT with zero-shot chain-of-thought prompting exhibits impressive personality recognition ability and is capable to provide natural language explanations through text-based logical reasoning. Furthermore, by employing the level-oriented prompting strategy to optimize zero-shot chain-of-thought prompting, the performance gap between ChatGPT and corresponding state-of-the-art model has been narrowed even more. However, we observe that ChatGPT shows unfairness towards certain sensitive demographic attributes such as gender and age. Additionally, we discover that eliciting the personality recognition ability of ChatGPT helps improve its performance on personality-related downstream tasks such as sentiment classification and stress prediction.
연구 동기 및 목표
- 텍스트 기반 성격 인식을 NLP 작업의 가치 있는 하류 신호로서 동기 부여한다.
- 다양한 프롬프트 전략하에서 사용자 생성 텍스트로부터 빅-다섯 성향(O, C, E, A, N)을 추론하는 ChatGPT의 능력을 평가한다.
- 두 데이터셋에서 ChatGPT를 RNN, RoBERTa 및 SOTA 모델과 비교한다.
- 자연어 설명을 통한 ChatGPT 출력의 해석 가능성을 탐구한다.
- 성별 및 연령대별 편향성 및 잠재적 하류 작업 이점에 대한 공정성 연구를 수행한다.
제안 방법
- 텍스트로부터 성향 수준(O, C, E, A, N)을 유도하기 위해 zero-shot, zero-shot CoT, 및 one-shot 프롬팅을 사용한다.
- 텍스트를 단어/문장/문서 수준으로 분석하기 위한 레벨 지향 CoT 프롬핑을 설계한다.
- Essays 및 PAN 데이터셋에서 RNN, RoBERTa 등의 베이스라인 및 SOTA(HPMN BERT)와 비교 평가한다.
- SOTA에 비해 정확도 및 AIP(accuracy improvement percentage)를 측정한다.
- CoT 프롬프트에 대해 자연어 설명이 포함된 ChatGPT 출력을 제공한다.
- 성별 및 연령 프롬프트를 도입하여 공정성을 분석하고 예측된 성향 수준 분포를 시각화한다.
실험 결과
연구 질문
- RQ1RQ1: 다양한 프롬핑 전략이 텍스트에서의 성격 식별에 대해 ChatGPT의 능력에 어떤 영향을 미치는가?
- RQ2RQ2: 민감한 인구통계 속성에 대해 성격 인식기로서 ChatGPT가 얼마나 불공정한가?
- RQ3RQ3: 추정된 성격이 감성 분류 및 스트레스 예측과 같은 하류 작업 성능을 향상시키는가?
주요 결과
- 제로샷 프롬핑 중 CoT가 프롬핑 전략 가운데 평균 성능 최상으로 나타나지만 여전히 SOTA보다 낮다.
- 제로샷 CoT 프롬핑은 자연어 설명과 예측의 해석 가능성 개선을 가능하게 한다.
- 레벨 지향 CoT 프롬핑(단어/문장/문서 수준)은 특정 텍스트 분석에서 정확도를 더욱 높일 수 있다.
- ChatGPT는 인구통계적 편향을 나타내며, 특정 특성에서 여성이 더 높은 것으로 예측되고 연령이 많은 개인은 개방성(Openness)에서 더 낮은 것으로 예측되는 경향이 있다.
- 발견된 성향 특성은 감성 분류 및 스트레스 예측과 같은 하류 작업의 성능을 향상시킬 수 있다.
- PAN에서 ChatGPT의 CoT_S(문장 수준) 및 CoT_D(문서 수준) 프롬핑은 특정 특성에서 주목할 만한 이점을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.