Skip to main content
QUICK REVIEW

[논문 리뷰] PsyCoT: Psychological Questionnaire as Powerful Chain-of-Thought for Personality Detection

Tao Yang, Tianyuan Shi|arXiv (Cornell University)|2023. 10. 31.
Mental Health via Writing인용 수 6
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 텍스트에서 성격 특성 추론을 위해 심리적 질문지(questionnaires)를 체인 오브 타ught(Chain-of-Thought, CoT) 추론 단계로 활용하는 새로운 제로샷 성격 감지 방법인 PsyCoT를 제안한다. LLM에 다중 대화형 대화를 통해 개인의 질문지 항목을 평가하도록 프롬프팅하여, 추론 정확도와 내구성을 향상시키며, 두 개의 벤치마크 데이터셋에서 표준 프롬프팅 대비 F1 점수를 평균 4.23~10.63 포인트 향상시켰고, 일부 미세조정된 모델보다도 뛰어난 성능을 보였다.

ABSTRACT

Recent advances in large language models (LLMs), such as ChatGPT, have showcased remarkable zero-shot performance across various NLP tasks. However, the potential of LLMs in personality detection, which involves identifying an individual's personality from their written texts, remains largely unexplored. Drawing inspiration from Psychological Questionnaires, which are carefully designed by psychologists to evaluate individual personality traits through a series of targeted items, we argue that these items can be regarded as a collection of well-structured chain-of-thought (CoT) processes. By incorporating these processes, LLMs can enhance their capabilities to make more reasonable inferences on personality from textual input. In light of this, we propose a novel personality detection method, called PsyCoT, which mimics the way individuals complete psychological questionnaires in a multi-turn dialogue manner. In particular, we employ a LLM as an AI assistant with a specialization in text analysis. We prompt the assistant to rate individual items at each turn and leverage the historical rating results to derive a conclusive personality preference. Our experiments demonstrate that PsyCoT significantly improves the performance and robustness of GPT-3.5 in personality detection, achieving an average F1 score improvement of 4.23/10.63 points on two benchmark datasets compared to the standard prompting method. Our code is available at https://github.com/TaoYang225/PsyCoT.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs)이 텍스트 데이터로부터 제로샷 성격 감지에 활용될 잠재력을 탐색하는 것. 이는 LLM의 강력한 제로샷 능력에도 불구하고 아직 탐색이 부족한 분야이다.
  • 표준 프롬프팅의 한계를 해결하기 위해 심리적 평가 도구에서 영감을 얻은 구조화된 추론 과정을 도입하는 것.
  • 인간 성격 테스트의 다단계 추론 과정을 모델링하여 LLM 기반 성격 추론의 정확도와 내구성을 향상시키는 것.
  • 잘 설계된 질문지가 효과적인 체인 오브 타ught 프롬프트가 될 수 있으며, 이로 인해 LLM이 미세조정된 모델과 비교할 만한 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • PsyCoT는 성격 감지를 다중 대화형 대화로 간주하며, LLM이 저자의 텍스트를 바탕으로 심리적 질문지의 개별 항목을 평가하는 AI 어시스턴트 역할을 한다.
  • 각 턴에서 질문지의 한 항목이 LLM에 프롬프팅되며, 텍스트에 기반해 점수를 할당함으로써 인간의 자가 평가 과정을 시뮬레이션한다.
  • 이전 평가 기록의 시퀀스는 표준 질문지 규칙을 사용해 집계되어 총성격 점수를 산출하고, 이는 최종 성격 예측에 활용된다.
  • 모델의 파라미터 업데이트 없이, 구조화된 심리적 질문지 항목을 CoT 단계로 활용하는 프롬프트 엔지니어링에 의존하는 인컨텍스트 러닝을 활용한다.
  • 이 프레임워크는 프롬프트의 순서나 후속 순서를 변형하여 안정성을 평가함으로써 제로샷 프롬프팅과 내구성 테스트를 모두 지원한다.
  • 이 방법은 두 가지 성격 모델(빅 파이브와 MBTI)을 사용하여 두 데이터셋(Essays 및 Kaggle)에서 평가되었다.

실험 결과

연구 질문

  • RQ1심리적 질문지를 효과적으로 체인 오브 타ught 추론 단계로 재활용하여 LLM 기반 성격 감지 성능을 향상시킬 수 있는가?
  • RQ2질문지 항목을 활용한 다중 대화형 프롬프팅 전략이 단일 대화형 또는 표준 프롬프팅보다 더 나은 성능을 내는가?
  • RQ3PsyCoT는 제로샷 성격 감지에서 미세조정된 모델과 비교해 어떻게 성능을 내는가?
  • RQ4옵션 순서를 뒤바꿔서 프롬프트를 변형하는 등의 변형에 대해 PsyCoT는 어느 정도 내구성을 보이는가?
  • RQ5입력 포스트의 순서가 PsyCoT와 같은 프롬프트 기반 성격 감지 방법의 성능에 영향을 미치는가?

주요 결과

  • PsyCoT는 Essays 및 Kaggle 데이터셋에서 표준 프롬프팅 대비 평균 F1 점수를 각각 4.23점과 10.63점 향상시켰다.
  • Essays 데이터셋에서 PsyCoT는 대부분의 성격 특성에서 몇몇 미세조정된 모델보다 뛰어난 성능을 보였으며, 미세조정 파라다임에서도 강력한 경쟁력을 입증했다.
  • 추론 정확도 향상 효과가 뚜렷하게 나타나, 아블레이션 연구에서 다중 대화형 프롬프팅이 단일 대화형 프롬프팅보다 유의미하게 높은 정확도를 보였다.
  • 옵션 순서를 뒤바꿔서 변형한 내구성 테스트에서 PsyCoT는 92.0%의 가장 높은 일관성 유지율을 기록했으며, 다른 프롬프트 기반 방법보다 뛰어난 성능을 보였다.
  • Kaggle 데이터셋에서 포스트 순서를 뒤섞는 것은 대부분의 성격 특성에 영향을 미치며, 입력 순서가 심지어 PsyCoT에서도 민감도 요소로 남아 있음을 시사한다.
  • 이 방법은 높은 내구성과 신뢰성을 보이며, 심리적 질문지에서 유도된 구조화된 CoT가 LLM의 추론 안정성을 향상시킨다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.