[論文レビュー] PersonaLLM: Investigating the Ability of Large Language Models to Express Personality Traits
この論文は、Big Fiveの特性に沿ったLLMペルソナを作成し、BFIによる自己申告の人格を評価し、LIWCで物語を分析し、人間とLLMsがAI作成ストーリーから人格をどう認識・予測するかを評価する。
Despite the many use cases for large language models (LLMs) in creating personalized chatbots, there has been limited research on evaluating the extent to which the behaviors of personalized LLMs accurately and consistently reflect specific personality traits. We consider studying the behavior of LLM-based agents which we refer to as LLM personas and present a case study with GPT-3.5 and GPT-4 to investigate whether LLMs can generate content that aligns with their assigned personality profiles. To this end, we simulate distinct LLM personas based on the Big Five personality model, have them complete the 44-item Big Five Inventory (BFI) personality test and a story writing task, and then assess their essays with automatic and human evaluations. Results show that LLM personas' self-reported BFI scores are consistent with their designated personality types, with large effect sizes observed across five traits. Additionally, LLM personas' writings have emerging representative linguistic patterns for personality traits when compared with a human writing corpus. Furthermore, human evaluation shows that humans can perceive some personality traits with an accuracy of up to 80%. Interestingly, the accuracy drops significantly when the annotators were informed of AI authorship.
研究の動機と目的
- LLMが割り当てられたBig Fiveの人格プロファイルを採用し、反映できるかを探る。
- LIWCを用いてLLMペルソナが生成したストーリーの言語パターンを定量化する。
- 読みやすさ、個人性、信憑性に関するAI生成ストーリーの人間とAIの認識を評価する。
- 人間とLLMがストーリーから作家のBig Five特性を推測できる程度を評価する。
- 自己申告のLLM人格スコアを、割り当てられたペルソナおよび人間が書いたテキストと比較する。
提案手法
- ChatGPTとGPT-4のために320のLLMペルソナを作成する(各2値のBig Five特性組み合わせごとに10個)。
- ペルソナに44項目のBig Five Inventory (BFI)を完了させ、800ワードの個人ストーリーを書かせる。
- LIWC-22でストーリーを分析し、心理言語特徴を抽出する。
- 人間とLLMの評価者に、GPT-4ストーリーのサブセットを6つの指標( Readability, Redundancy, Cohesiveness, Likeability, Believability, Personalness)で評価させる。
- ストーリーから作家のBig Five特性を予測するよう評価者に求める(binaryとLikertベースの分析)。
- LLMペルソナBFIスコアを割り当てられたプロフィールと比較し、LIWC特徴と人格特性の相関を分析する。
実験結果
リサーチクエスチョン
- RQ1RQ1: LLMはBFI評価を完了する際、割り当てられたBig Fiveペルソナを反映できるか。
- RQ2RQ2: LLMペルソナが生成したストーリーにはどのような言語パターンが見られるか。
- RQ3RQ3: 人間とLLMは、LLMペルソナが生成したストーリーをどのように評価するか。
- RQ4RQ4: 人間とLLMは、LLMペルソナによって書かれたストーリーからBig Fiveの人格特性を正確に認識できるか。
主な発見
- LLMペルソナは、BFIスコアにおいて5つのBig Five全てで大きく、統計的に有意な差を示し、割り当てられたペルソナと一致する。
- ChatGPTとGPT-4のBFI結果には差があり、GPT-4は一般に人間らしいLIWCパターンとより強く整合する傾向を示す。
- GPT-4のストーリーは、読みやすさ、結束性、信憑性の点で人間とLLM評価者の双方から高得点を得るが、AI作者であることが開示されると個人性は低く評価される。
- 人間とGPT-4は、ストーリーからExtraversionとAgreeablenessを偶然以上の精度で予測でき、多数決投票によって全体の正確さが向上する一方、AI著作である認識は予測精度を低下させる。
- LIWC分析は、特性と関連する言語パターンを示し(例:Opennessは好奇心系語彙、Neuroticismは不安/否定的トーン)、人間の著作との重複はGPT-4でより高く、ChatGPTよりも高い。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。