[論文レビュー] Can ChatGPT Read Who You Are?
本研究では、ChatGPT がチェコ語の短いテキストから Big Five Inventory (BFI) を基準として人格特徴を推論できるかを調査している。ChatGPT は人間のレーティングと同等の性能を示すが、全特徴で一貫したポジティビティバイアスを示しており、その性能はプロンプト設計に著しく影響を受けることが明らかになった。
The interplay between artificial intelligence (AI) and psychology, particularly in personality assessment, represents an important emerging area of research. Accurate personality trait estimation is crucial not only for enhancing personalization in human-computer interaction but also for a wide variety of applications ranging from mental health to education. This paper analyzes the capability of a generic chatbot, ChatGPT, to effectively infer personality traits from short texts. We report the results of a comprehensive user study featuring texts written in Czech by a representative population sample of 155 participants. Their self-assessments based on the Big Five Inventory (BFI) questionnaire serve as the ground truth. We compare the personality trait estimations made by ChatGPT against those by human raters and report ChatGPT's competitive performance in inferring personality traits from text. We also uncover a 'positivity bias' in ChatGPT's assessments across all personality dimensions and explore the impact of prompt composition on accuracy. This work contributes to the understanding of AI capabilities in psychological assessment, highlighting both the potential and limitations of using large language models for personality inference. Our research underscores the importance of responsible AI development, considering ethical implications such as privacy, consent, autonomy, and bias in AI applications.
研究の動機と目的
- チェコ語(非英語)の短い文章から人格特徴を推論する ChatGPT の能力を評価すること。
- 自己報告による BFI 評価を基準として、ChatGPT の人格特徴推定を人間レーティングと比較すること。
- 大規模言語モデル(LLM)による人格評価に、ポジティビティバイアスが存在し、それがどのように影響を及えるかを調査すること。
- 異なるプロンプト構成が、ChatGPT による人格推定の正確性にどのように影響するかを分析すること。
- AI駆動のユーザーモデリングにおけるプライバシー、同意、自律性、バイアスといった倫理的含みを強調すること。
提案手法
- 155名のチェコ語話者を対象にしたユーザースタディを実施。参加者は4種類の短いテキストを執筆し、人格評価として Big Five Inventory (BFI) を完了した。
- 参加者の自己評価を、外向性、協調性、誠実性、神経症傾向、開放性という5次元の人格特徴の基準として使用した。
- ゼロショット、フェイシング、チェーン・オブ・トゥキャウトのプロンプト戦略を用いて、ChatGPT のパフォーマンスを評価する複数のプロンプトバージョンを採用した。
- 平均、中央値、最頻値、標準偏差、変動係数といった記述統計を用い、ChatGPT の予測分布と人間・自己評価との比較評価を実施した。
- 各人格次元について、低、中、高の3段階のレベルで、ChatGPT の予測の一貫性と正確性を分析した。
- ChatGPT の出力と人間レーティング(H_A および H_B)および他の LLM バージョン(GPT-TL、GPT-DTL など)を比較し、相対的なパフォーマンスとバイアスパターンを評価した。

実験結果
リサーチクエスチョン
- RQ1ChatGPT は、自己報告による BFI 評価を基準として、チェコ語で書かれた短いテキストから人格特徴を正確に推論できるか?
- RQ2ChatGPT の人格推定パフォーマンスは、人間レーティングと比べてどの程度か?
- RQ3ChatGPT は、5つの人格次元すべてにおいて、体系的なポジティビティバイアスを示しているか?
- RQ4プロンプト構成は、ChatGPT による人格推定の正確性にどの程度影響を及えるか?
- RQ5実世界の応用において、ChatGPT のような LLM を用いた自動的人格評価に、どのような倫理的含みがあるか?
主な発見
- ChatGPT は、短いチェコ語テキストからの人格特徴推定において、競争力のあるパフォーマンスを示した。多くの次元で、平均スコアが自己評価と密接に一致した。
- ChatGPT の評価には一貫したポジティビティバイアスが観察された。全5つの人格特徴において、予測スコアが自己評価よりも系統的に高く、特に低・中程度のスケールで顕著だった。
- 神経症傾向の高スコア群では、ChatGPT の平均予測スコアが 1.805 にとどまり、高スコアの神経症傾向を著しく低く評価していることが示された。同様に、開放性の高スコア群では平均スコアが 2.041 であり、高スコアの開放性も低く評価されていることがわかった。
- プロンプト設計はパフォーマンスに顕著な影響を与えた。フェイシングおよびチェーン・オブ・トゥキャウトのプロンプト戦略(例:GPT-DLT)はゼロショットのベースラインを上回る正確性を示し、特に高スコア群の開放性では GPT-DLT が平均 2.789 のスコアを記録した。
- 人間レーティング(H_A および H_B)は、神経症傾向や開放性において、ChatGPT よりも自己評価とより一貫性を示した。ChatGPT の平均予測は、自己報告と比較して常に低く、特にこれらの次元で顕著だった。
- ChatGPT の予測の変動係数は、人間レーティングよりも一般的に低く、より一貫性のあるが、変動の少ない応答を示していた。これは、個々の差異に対する感受性に欠ける可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。