[論文レビュー] SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
本稿は、ロールプレイ会話エージェントの社会的知性を個別およびグループレベルの両方で体系的に評価する最初のベンチマークであるRoleInteractを紹介する。エージェントが個別対話において優れたパフォーマンスを示す場合でも、グループ設定では社会的好みのずれや複雑なグループダイナミクス下での記憶性能の低下が生じ、パフォーマンスが低下することが明らかになった。
Large language models (LLMs) have advanced the development of various AI conversational agents, including role-playing conversational agents that mimic diverse characters and human behaviors. While prior research has predominantly focused on enhancing the conversational capability, role-specific knowledge, and stylistic attributes of these agents, there has been a noticeable gap in assessing their social intelligence. In this paper, we introduce SocialBench, the first benchmark designed to systematically evaluate the sociality of role-playing conversational agents at both individual and group levels of social interactions. The benchmark is constructed from a variety of sources and covers a wide range of 500 characters and over 6,000 question prompts and 30,800 multi-turn role-playing utterances. We conduct comprehensive evaluations on this benchmark using mainstream open-source and closed-source LLMs. We find that agents excelling in individual level does not imply their proficiency in group level. Moreover, the behavior of individuals may drift as a result of the influence exerted by other agents within the group. Experimental results on SocialBench confirm its significance as a testbed for assessing the social interaction of role-playing conversational agents. The benchmark is publicly accessible at https://github.com/X-PLUG/SocialBench.
研究の動機と目的
- ロールプレイ会話エージェントにおける社会的知性の体系的評価の欠如に応えること。
- 個別およびグループレベルの社会的相互作用能力を捉えるベンチマークを設計すること。
- ロールプレイエージェントが動的なグループ影響下でも社会的好みや記憶をどのように維持するかを測定すること。
- LLMベースのエージェントにおける個別およびグループレベルの社会的行動のパフォーマンスギャップを特定すること。
提案手法
- 英語および中国語の書籍、映画、小説など多様なソースから構築されたRoleInteractは、500文字および6,000件の質問プロンプトをカバーしている。
- 3段階のパイプラインを採用した:(1) Webソースからロールプロフィールを収集、(2) GPT-4を用いて対話シーンおよび選択肢付き質問を抽出、(3) プリプロセッシングおよび人間による検証による品質管理。
- 個別的社会性を評価するための評価タスクを設計:ロール記述の自己認識、環境の感情認識、長期記憶、グループダイナミクスにおける社会的好み。
- 自動化されたメトリクスと人間によるアノテーションによる検証を用いて、10種類の主流のオープンソースおよびクローズドソースLLMを、個別およびグループレベルのタスクで評価。
- グループ複雑度(メンバー数)および極性(肯定的、中立的、否定的)の変化に伴うパフォーマンストレンドを分析。
- 長時間の対話(80ターン以上)における記憶の劣化を追跡し、グループダイナミクスに伴う好みのずれを測定。

実験結果
リサーチクエスチョン
- RQ1ロールプレイエージェントは、自己認識、感情認識、長期記憶といった個別レベルの社会的タスクでどの程度のパフォーマンスを示すか?
- RQ2グループダイナミクスは、ロールプレイエージェントの社会的行動および一貫性にどの程度影響を及えるか?
- RQ3単純なグループ対話においての熟練度は、複雑なグループ環境でのパフォーマンスを予測できるか?
- RQ4肯定的、中立的、否定的な社会的好みが、グループ極性の変化に伴いエージェント行動にどのように影響を与えるか?
- RQ5長期間または複雑な社会的相互作用において、エージェントがどの程度好みのずれや記憶の劣化を示すか?
主な発見
- 個別レベルの社会的タスクで優れたパフォーマンスを示すエージェントが、グループレベルの相互作用でも同様に優れたパフォーマンスを示すとは限らず、集団的・社会的知性における顕著なギャップが存在することが示された。
- 長時間の会話ではパフォーマンスが著しく低下する:記憶能力は80ターンを超えると著しく低下し、特にGPT-3.5-TurboやCharGLM-3のようなモデルで顕著だった。
- グループの複雑度が増す(メンバー数が増える)と、すべてのエージェントがパフォーマンスを低下させ、複雑なグループダイナミクスの処理が依然として大きな課題であることが示された。
- 中立的または否定的な社会的好みを持つエージェントは、逆極性のグループに配置された際に好みのずれを示し、設計された行動から逸脱しやすくなる。
- 肯定的な社会的好みを持つエージェントはグループ極性の変化に対して回復力があり、一貫したパフォーマンスを示す。特に否定的極性のグループでも優れたパフォーマンスを発揮し、ある種の社会的促進効果が見られた。
- Xingchen-Plus や Minimax-abab6-chat といった、マルチターンロールプレイデータで微調整されたモデルは、汎用モデルに比べ、複雑なグループダイナミクスにおいてより高い耐性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。