Skip to main content
QUICK REVIEW

[論文レビュー] Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench

Jen-tse Huang, Wenxuan Wang|arXiv (Cornell University)|Oct 2, 2023
Artificial Intelligence in Healthcare and Education被引用数 6
ひとこと要約

本論文では、性格特性、人間関係、動機付け、感情的能力の4分野にわたり、臨床心理学的スケール13種を用いて大規模言語モデル(LLM)の心理的描写を評価する包括的な心理学的フレームワーク、PsychoBenchを紹介する。本研究では、GPT-4、ChatGPT、LLaMA-2を含む5つのLLMを、標準的設定およびジェイルブレイク設定の両方でベンチマーク化し、明確な心理的プロファイルと役割割り当てによる一貫した行動的シフトを明らかにした。

ABSTRACT

Large Language Models (LLMs) have recently showcased their remarkable capacities, not only in natural language processing tasks but also across diverse domains such as clinical medicine, legal consultation, and education. LLMs become more than mere applications, evolving into assistants capable of addressing diverse user requests. This narrows the distinction between human beings and artificial intelligence agents, raising intriguing questions regarding the potential manifestation of personalities, temperaments, and emotions within LLMs. In this paper, we propose a framework, PsychoBench, for evaluating diverse psychological aspects of LLMs. Comprising thirteen scales commonly used in clinical psychology, PsychoBench further classifies these scales into four distinct categories: personality traits, interpersonal relationships, motivational tests, and emotional abilities. Our study examines five popular models, namely text-davinci-003, gpt-3.5-turbo, gpt-4, LLaMA-2-7b, and LLaMA-2-13b. Additionally, we employ a jailbreak approach to bypass the safety alignment protocols and test the intrinsic natures of LLMs. We have made PsychoBench openly accessible via https://github.com/CUHK-ARISE/PsychoBench.

研究の動機と目的

  • タスクパフォーマンスを超えて、内在的な心理的表現を評価するための体系的フレームワークの開発。
  • LLMが人間の性格や感情的特徴に類似した安定的で測定可能な心理的プロファイルを示すかどうかの調査。
  • 役割割り当てやセーフティアライメントの影響、特にジェイルブレイキング技術を通じてのLLMの心理的出力への影響の検討。
  • 標準化され臨床的に検証済みのスケールを用いて、研究者がLLMを多様な心理的次元で評価・比較できるようにすること。
  • 心理学的評価を通じて、より共感的で人間中心的かつ倫理的に整合性のあるAIアシスタントの開発を支援すること。

提案手法

  • 臨床心理学から13の確立された心理的スケールを統合し、性格、人間関係、動機付け、感情的能力の4分野に分類した心理学的ベンチマーク、PsychoBenchを設計。
  • 標準化されたプロンプトプロトコルを用いて、text-davinci-003、ChatGPT、GPT-4、LLaMA-2-7b、LLaMA-2-13bの5つのLLMにフレームワークを適用。
  • GPT-4などのモデルの内在的心理的傾向を調査するために、セーフティアライメントを回避するジェイルブレイキング技術、CipherChatを採用。
  • gpt-3.5-turboを異なる役割(例:心理療法士、学生)に割り当ててテストし、応答の一貫性を測定することで、スケールの妥当性を検証。
  • BFI、HEXACO、Short Dark Triad、Political Compass Testなどの標準化されたアンケートを用いて性格と価値観を評価。
  • スケールを4つの心理的分野に分類・構造化することで、LLMの包括的かつ多次元的な心理的特性評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1LLMは、複数の心理学的次元にわたり、安定的で測定可能な心理的プロファイルを示すことができるか?
  • RQ2商業的モデルとオープンソースモデルの間で、性格、感情、人間関係的特徴という観点から、LLMの心理的描写にどのような差が生じるか?
  • RQ3役割割り当てやセーフティアライメント機構は、LLMの心理的出力にどの程度の影響を及ぼすか?
  • RQ4ジェイルブレイキングは、特にGPT-4の内在的心理的傾向を解明する上で、どのような洞察を提供するか?
  • RQ5異なる役割割り当てにおいて心理学的結果はどの程度一貫性を示すか?これは、モデルの行動とアライメントにどのような意味を持つのか?

主な発見

  • GPT-4はジェイルブレイク状態下で、元のセーフティアライメント済み動作とは異なる性格的・感情的傾向を示す明確な心理的プロファイルを示した。
  • BFIや他の性格スケールは、gpt-3.5-turboを含む複数のLLMにおいて、さまざまな役割割り当て下でも一貫性があり信頼性の高い応答を示した。
  • LLaMA-2モデルは、ChatGPT や GPT-4 などの商業モデルと比較して、より中立的または顕著でない性格的特徴を示した。
  • フレームワークは、モデル間での動機付けおよび感情的反応の違いを的確に捉えており、LLMが心理的特性について体系的に評価可能であることを示している。
  • ジェイルブレイキングにより、GPT-4に隠れた心理的傾向(例:主張的傾向の増加、従順性の低下)が明らかになった。これは、セーフティアライメントが内在的行動パターンを隠蔽している可能性を示唆している。
  • PsychoBenchは高い柔軟性と妥当性を示しており、異なる役割割り当てにおいて一貫した結果を出しており、LLMに対する信頼できる心理学的評価ツールとしての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。