Skip to main content
QUICK REVIEW

[論文レビュー] Can ChatGPT Assess Human Personalities? A General Evaluation Framework

Haocong Rao, Cyril Leung|arXiv (Cornell University)|Mar 1, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、ChatGPT などの大規模言語モデル(LLM)がMBTIテストを用いて人間の性格を評価できる一般化された評価フレームワークを提案する。不偏なプロンプト、被験者置換クエリ、正答性評価付きの指示を採用することで、一貫性があり、公平で、柔軟な性格評価が可能となる。実験の結果、ChatGPTはInstructGPTよりも一貫性と公平性に優れるが、プロンプトバイアスに対しては低い耐性を示すことが判明した。

ABSTRACT

Large Language Models (LLMs) especially ChatGPT have produced impressive results in various areas, but their potential human-like psychology is still largely unexplored. Existing works study the virtual personalities of LLMs but rarely explore the possibility of analyzing human personalities via LLMs. This paper presents a generic evaluation framework for LLMs to assess human personalities based on Myers Briggs Type Indicator (MBTI) tests. Specifically, we first devise unbiased prompts by randomly permuting options in MBTI questions and adopt the average testing result to encourage more impartial answer generation. Then, we propose to replace the subject in question statements to enable flexible queries and assessments on different subjects from LLMs. Finally, we re-formulate the question instructions in a manner of correctness evaluation to facilitate LLMs to generate clearer responses. The proposed framework enables LLMs to flexibly assess personalities of different groups of people. We further propose three evaluation metrics to measure the consistency, robustness, and fairness of assessment results from state-of-the-art LLMs including ChatGPT and GPT-4. Our experiments reveal ChatGPT's ability to assess human personalities, and the average results demonstrate that it can achieve more consistent and fairer assessments in spite of lower robustness against prompt biases compared with InstructGPT.

研究の動機と目的

  • 大規模言語モデル(LLM)が、ほとんど未開拓とされる人間の性格評価という能力を有するかどうかを調査すること。
  • MBTIを用いてLLMが定量的な性格評価を実施できる一般的で、柔軟かつ信頼性の高い評価フレームワークを構築すること。
  • 異なる被験者やプロンプトの変化に対して、LLMが生成する性格評価の一致度、耐性、公平性を測定すること。
  • LLMの性格評価に潜在する可能性のあるバイアスを特定し、より安全で信頼性の高いAIシステムの構築に寄与すること。

提案手法

  • MBTIの質問における選択肢の順序をランダムに並び替えることで不偏なプロンプトを設計し、複数回の実行結果を平均化することで応答バイアスを低減する。
  • MBTI文の被験者を置き換えるクエリを実装することで、異なる個人や集団に対する柔軟な評価が可能になる。
  • 質問の指示文を再構成し、正答性の評価に焦点を当てるようにすることで、LLMがより明確で分析可能な応答を生成するよう促す。
  • 3つの評価指標を提案する:一貫性(評価の再現性)、耐性(プロンプトの摂動に対する感受性)、公平性(性別にかかわらず均等な扱い)。
  • 標準化されたテスト条件下で、ChatGPT、GPT-4、InstructGPTを含む最先端のLLMに対してフレームワークを適用して評価する。
  • MBTIを代表的な性格フレームワークとして用いることで、モデル間での定量的評価と比較が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ChatGPT などのLLMは、MBTI などの標準化された心理学的フレームワークを用いて、人間の性格を信頼性高く評価できるか?
  • RQ2性格評価において、異なるLLMは一貫性、耐性、公平性の観点でどのように比較できるか?
  • RQ3プロンプトの変化や被験者の置換が、LLMが生成する性格評価の信頼性と中立性にどの程度影響を与えるか?
  • RQ4提案されたフレームワークは、性別を含む被験者に応じたバイアスを検出・低減できるか、特に性別に偏った評価のリスクを明らかにできるか?

主な発見

  • ChatGPT は性格評価において高い一貫性と公平性を示し、プロンプトの摂動に対して低い耐性を示すものの、InstructGPT を上回る性能を発揮した。
  • 複数回の実行における平均的評価結果は、ChatGPT と GPT-4 の両者で高い一貫性を示しており、安定した性格推論行動が確認された。
  • 被験者置換クエリにより、再トレーニングなしに多様な個人や人口統計的グループに対して柔軟かつスケーラブルな性格評価が可能になった。
  • 正答性評価付きの指示を採用することで、LLMが生成する応答の明確さと分析的整合性が顕著に向上した。
  • フレームワークはLLMに潜在するバイアスを効果的に特定でき、特に性別を含む被験者に適用した場合のステレオタイプ化のリスクを浮き彫りにした。
  • 実験結果から、LLMが意味のある性格評価を実施できることを確認した。これは、人間と同様の心理的推論や認識能力を有している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。