Skip to main content
QUICK REVIEW

[論文レビュー] InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological Interviews

Xintao Wang, Xiao, Yunze|arXiv (Cornell University)|Oct 27, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、自己報告による評価に頼らず、標準化されたパーソナリティ尺度を用いた心理的インタビューを通じて、ロールプレイングエージェント(RPAs)のパーソナリティ整合性を評価する新手法InCharacterを提案する。この手法は、32体のキャラクターと14の心理的尺度を用いて、RPAのパーソナリティを人間が認識するキャラクター特性と一致させる際に最大80.7%の正確性を達成した。

ABSTRACT

Role-playing agents (RPAs), powered by large language models, have emerged as a flourishing field of applications. However, a key challenge lies in assessing whether RPAs accurately reproduce the personas of target characters, namely their character fidelity. Existing methods mainly focus on the knowledge and linguistic patterns of characters. This paper, instead, introduces a novel perspective to evaluate the personality fidelity of RPAs with psychological scales. Overcoming drawbacks of previous self-report assessments on RPAs, we propose InCharacter, namely Interviewing Character agents for personality tests. Experiments include various types of RPAs and LLMs, covering 32 distinct characters on 14 widely used psychological scales. The results validate the effectiveness of InCharacter in measuring RPA personalities. Then, with InCharacter, we show that state-of-the-art RPAs exhibit personalities highly aligned with the human-perceived personalities of the characters, achieving an accuracy up to 80.7%.

研究の動機と目的

  • 既存の手法が知識や言語的再現性に注目する中で、ロールプレイングエージェント(RPAs)のパーソナリティ整合性を評価するというギャップを解消すること。
  • 自己報告評価の限界(誘導の矛盾や応答バイアス)を克服するため、インタビューに基づく評価フレームワークを導入すること。
  • 人間の心理学者が誘導付き会話でパーソナリティを評価するのを模倣した、スケーラブルでエキスパートに似た評価プロトコルを開発すること。
  • BFI、16P、DTDDを含む14の広く使われている心理的尺度を用い、18体のキャラクターに対して人間がラベルを付与したデータを用いて、RPAパーソナリティ評価のベンチマークを構築すること。
  • 最先端のRPAsが、ターゲットキャラクターに対する人間の認識と高い一致を示すパーソナリティプロファイルを示すことを実証すること。

提案手法

  • InCharacterは二段階のプロセスを採用する:(1) インタビュー — RPAsに心理的尺度に基づく開放的質問を提示し、行動的・認知的・感情的反応を引き出す。
  • 第二段階では、LLMがRPAの反応を解釈し、リッカート尺度のスコアに割り当てたり、精神科医の判断を模倣してパーソナリティ特徴を推定する。
  • 本手法は、Big Five Inventory(BFI)、16Personalities(16P)、Dark Triad Dirty Dozen(DTDD)などの標準化された心理的尺度を用い、コアなパーソナリティ次元を探る質問を設計している。
  • BFIおよび16Pのパーソナリティラベルは、Personality Database(PDb)から入手しているが、他の尺度については、キャラクターに精通した人間のアノテーターがラベルを提供することで正確性を確保している。
  • 本手法は、ロールプレイと矛盾する自己報告の指示を避け、代わりにRPAの物語的文脈と役割に整合した行動の中にパーソナリティ評価を埋め込んでいる。
  • 評価は32体の異なるキャラクターと14の尺度を対象とし、LLMによる解釈と人間によるアノテーションによる真値の両方を用いて検証を行っている。

実験結果

リサーチクエスチョン

  • RQ1InCharacterは、インタビューに基づく心理的評価を用いて、ロールプレイングエージェントのパーソナリティ特徴をどれほど正確に測定できるか?
  • RQ2最先端のRPAsのパーソナリティ整合性は、同じキャラクターに対する人間が認識するパーソナリティプロファイルと比べてどの程度一致するか?
  • RQ3インタビューに基づく手法は、従来の自己報告法に比べて、RPAのパーソナリティ整合性を評価するうえで、どのような点で優れているか?
  • RQ4エキスパートに似た解釈によって評価された場合、RPAの反応は、確立された心理的尺度とどの程度一貫性を示すか?
  • RQ5InCharacterは、多様なキャラクター種別と心理的フレームワークに一般化可能か?

主な発見

  • InCharacterは、人間が認識するキャラクター特徴と高い一致を示すRPAパーソナリティ整合性を測定でき、32体のキャラクターを対象に最大80.7%の正確性を達成した。
  • 本手法は自己報告評価に比べて優れた性能を示し、誘導の矛盾や応答バイアスのため、しばしば誤った結果を生じる自己報告法の限界を克服している。
  • 最先端のRPAsは、人間によるアノテーションラベルと高い一貫性を示すパーソナリティプロファイルを示しており、強力なパーソナリティ整合性を示している。
  • LLMを用いてインタビュー形式の反応を解釈することで、自己報告法よりも洗練され、行動に根ざしたパーソナリティ評価が得られた。
  • 14の心理的尺度と18体のキャラクターに対する人間によるラベルを含むベンチマークは、RPAパーソナリティ整合性の信頼性と再現可能性のある評価を可能にした。
  • 結果から、心理的インタビューに基づく評価は、RPAsのマインドセットと行動パターンを評価するうえで、より強固で代表的であることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。