[論文レビュー] Challenging the Validity of Personality Tests for Large Language Models
本稿は、大規模言語モデル(LLMs)に対して人間のパーソナリティテスト(特にIPIP Big FiveおよびBFI-2)を用いることの妥当性に疑問を呈する。LLMsは人間の応答パターンを体系的に再現できず、肯定的・否定的語句を併用して一貫性のない応答を示し、人間データに見られる5要因構造も示さない。これは、LLMsに対してパーソナリティに類似する特徴を信頼性を持って推定できないことを示している。
With large language models (LLMs) like GPT-4 appearing to behave increasingly human-like in text-based interactions, it has become popular to attempt to evaluate personality traits of LLMs using questionnaires originally developed for humans. While reusing measures is a resource-efficient way to evaluate LLMs, careful adaptations are usually required to ensure that assessment results are valid even across human subpopulations. In this work, we provide evidence that LLMs' responses to personality tests systematically deviate from human responses, implying that the results of these tests cannot be interpreted in the same way. Concretely, reverse-coded items ("I am introverted" vs. "I am extraverted") are often both answered affirmatively. Furthermore, variation across prompts designed to "steer" LLMs to simulate particular personality types does not follow the clear separation into five independent personality factors from human samples. In light of these results, we believe that it is important to investigate tests' validity for LLMs before drawing strong conclusions about potentially ill-defined concepts like LLMs' "personality".
研究の動機と目的
- 人間向けに設計されたパーソナリティテストが大規模言語モデル(LLMs)に適用された場合に有効であるかどうかを調査すること。
- 標準的心理的アンケートで測定される際、LLMsが一貫性があり解釈可能なパーソナリティ特徴を示すかどうかを評価すること。
- パーソナリティの5要因構造(例:外向性、神経質性)がLLMsの応答において成立するかどうかを評価すること。
- 妥当なテストの移行に不可欠な測定不変性が、人間からLLMsへと適用可能かどうかを検証すること。
- LLMsのパーソナリティテストへの応答を、自己組織的パーソナリティ特徴の兆候と解釈することを警告すること。
提案手法
- 複数のLLMs(例:GPT-3.5、Llama 2)に50項目のIPIP Big Fiveマーカーを提示し、応答パターンを分析した。
- プロンプト工学を用いて、LLMsがBFI-2アンケートに回答する際に特定のパーソナリティタイプを模倣するように誘導した。
- 確認的要因分析(CFA)を用いて、LLMsの応答が確立されたパーソナリティの5要因モデルに適合するかを検証した。
- 比較的適合指数(CFI)、タッカー=ルイス指数(TLI)、近似の平均平方誤差(RMSEA)といった標準指標を用いてモデル適合度を評価した。
- 要因構造の内部的一致性と信頼性を評価するため、マクドナルドのオメガ階層的(ωh)を計算した。
- LLMsと人間のサンプル間でCFAの結果を比較し、測定不変性および構造的妥当性を検証した。

実験結果
リサーチクエスチョン
- RQ1LLMsは人間の応答パターンと整合した方法でパーソナリティテストに応答するのか?
- RQ2BFI-2へのLLMsの応答から、パーソナリティの5要因構造を信頼性を持って回復できるのか?
- RQ3逆数値化された項目(例:「私は内向的である」対「私は外向的である」)に対して、LLMsは一貫性があり矛盾のない応答を示すのか?
- RQ4人間からLLMsにテストを移行する際、パーソナリティテストの測定不変性が保持されるのか?
- RQ5LLMsのパーソナリティテスト結果を、自己組織的パーソナリティ特徴の証拠と解釈できる程度はどの程度か?
主な発見
- LLMsは頻繁に肯定的語句と否定的語句の両方を認め(例:「私は内向的である」と「私は外向的である」)、体系的な応答の不一致を示している。
- 確認的要因分析(CFA)の結果、すべてのLLMsにおいてBFI-2の5要因モデルへの適合度が低く、CFI < 0.95かつRMSEA > 0.06であった。
- 各特徴に3つのサブ要因を含めるモデル拡張を行ったが、LLMsの応答は人間データとは異なり、妥当な適合指標に達しなかった。
- 一般要因とサブ要因を含む階層的CFAモデルは、LLMsの15件中8件で収束しなかった。これは構造的不安定性を示している。
- モデル収束の問題と適合度の悪さのため、大多数のLLMsではマクドナルドのオメガ階層的(ωh)を信頼性を持って計算できなかった。
- LLMsのパーソナリティテストへの応答は、人間サンプルで観察される潜在的要因構造を再現できず、パーソナリティ推論の妥当性が損なわれている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。