[論文レビュー] Large Language Models Can Infer Personality from Free-Form User Interactions
本研究では、GPT-4を搭載したチャットボットが自由形式のユーザー相互作用から中程度の正確さでオウル・ファイブ性格特性を推定できることを示している。静的テキストベースの手法よりも優れた性能を発揮する。最高の正確さ(平均 r = .443)は、ユーザー体験に悪影響を及けない形で、性格関連の情報を引き出すようプロンプトされたチャットボットで達成された。これは、大規模かつ動的な自然状況下での心理的プロファイリングにおけるLLMの潜在的可能性を示している。
This study investigates the capacity of Large Language Models (LLMs) to infer the Big Five personality traits from free-form user interactions. The results demonstrate that a chatbot powered by GPT-4 can infer personality with moderate accuracy, outperforming previous approaches drawing inferences from static text content. The accuracy of inferences varied across different conversational settings. Performance was highest when the chatbot was prompted to elicit personality-relevant information from users (mean r=.443, range=[.245, .640]), followed by a condition placing greater emphasis on naturalistic interaction (mean r=.218, range=[.066, .373]). Notably, the direct focus on personality assessment did not result in a less positive user experience, with participants reporting the interactions to be equally natural, pleasant, engaging, and humanlike across both conditions. A chatbot mimicking ChatGPT's default behavior of acting as a helpful assistant led to markedly inferior personality inferences and lower user experience ratings but still captured psychologically meaningful information for some of the personality traits (mean r=.117, range=[-.004, .209]). Preliminary analyses suggest that the accuracy of personality inferences varies only marginally across different socio-demographic subgroups. Our results highlight the potential of LLMs for psychological profiling based on conversational interactions. We discuss practical implications and ethical challenges associated with these findings.
研究の動機と目的
- 大規模言語モデル(LLM)が動的で自由形式のユーザー相互作用からオウル・ファイブ性格特性を推定できるかどうかを調査すること。
- 性格評価、自然主義的会話、アシスタントモードの3つの異なる会話プロンプト条件における、性格推定の正確さを比較すること。
- 異なる相互作用設定における推定正確さとユーザー体験の間の妥協可能性を評価すること。
- 性別、年齢、人種、教育水準、所得水準の各要因におけるLLMベースの性格推定におけるデモグラフィックバイアスを検討すること。
- 実世界の応用において、大規模かつ不顕著な心理的プロファイリングにLLMを使用する倫理的・実用的含意を検討すること。
提案手法
- Prolific Academicを介して米国の参加者566名を対象に、3×2の被験者内実験デザインを実施した。
- 性格評価、自然主義的会話、役立つアシスタントモードの3つの異なるプロンプト条件において、GPT-4をLLMベースのチャットボットとして使用した。
- ユーザーが自然に会話するか、個人的な目的でチャットボットを利用した自由形式の会話相互作用を収集した。
- 比較のための基準値として、参加者にBig Five Inventory-10(BFI-10)を実施した。
- 各特性および条件ごとに、LLMが推定した性格スコアと参加者が自己報告したBFI-10スコアとの間のゼロ次相関(r)を計算した。
- 会話の自然さ、快適さ、関与度、人間らしさの各尺度を用いた標準化されたスケールを用いて、ユーザー体験を評価した。
実験結果
リサーチクエスチョン
- RQ1LLMベースのチャットボットは、静的テキストベースの手法よりも、自由形式のユーザー相互作用からオウル・ファイブ性格特性をより正確に推定できるか?
- RQ2会話プロンプト戦略(例:性格評価対自然主義的会話)が、性格推定の正確さにどのように影響するか?
- RQ3LLMに性格評価に焦点を当てるようプロンプトすることで、より自然な会話やアシスタント風の相互作用と比較して、ユーザー体験が悪化するか?
- RQ4性別、年齢、人種、教育水準、所得水準の各要因において、LLMベースの性格推定に測定可能なデモグラフィックバイアスが存在するか?
- RQ5短いタスク指向の交信と比較して、より長時間またはより自然に発生する相互作用は、性格推定の正確さをどのように向上させるか?
主な発見
- 性格関連の情報を引き出すようプロンプトされたチャットボットが、オウル・ファイブ特性の全般で最高の推定正確さを達成した。平均相関係数は r = .443(範囲:.245〜.640)であった。
- 自然主義的会話条件では、平均相関係数が r = .218(範囲:.066〜.373)にとどまり、中程度の正確さであり、ターゲット評価条件より低い正確さであった。
- デフォルトの「役立つアシスタント」モードでは正確さが最低であった(平均 r = .117、範囲:-.004〜.209)、ただし心理的に意味のある情報を一部捉えていた。
- ユーザー体験は全条件で一貫して高く、自然さ、快適さ、関与度、人間らしさの観点で有意差は認められなかった。
- 初期分析では、デモグラフィックサブグループ間での推定正確さの差は僅かにしか認められず、モデルの性能に限られたデモグラフィックバイアスがあると考えられる。
- 本研究では、より長時間またはより自然に発生する相互作用が、推定正確さのさらなる向上に寄与する可能性があると示唆されているが、現在の結果は短い相互作用に基づいている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。