Skip to main content
QUICK REVIEW

[論文レビュー] How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO

Man Tik Ng, Hui Tung Tse|arXiv (Cornell University)|Apr 22, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

この論文は、実際の人物のプロフィールを用いて、一般の人々としての役割を果たす大規模言語モデル(LLM)の評価を目的とした、チューリングテストにインspiredされたフレームワークECHOを紹介する。GPTsは知人をだませる割合が48.3%にのぼり、GPT-3.5やGPT-4を上回る性能を示した一方で、GPT-4のようなLLMは機械生成テキストを検出できるが、人間が書いたコンテンツを特定するのは苦手であり、モデル固有のバイアスが明らかになった。

ABSTRACT

The role-play ability of Large Language Models (LLMs) has emerged as a popular research direction. However, existing studies focus on imitating well-known public figures or fictional characters, overlooking the potential for simulating ordinary individuals. Such an oversight limits the potential for advancements in digital human clones and non-player characters in video games. To bridge this gap, we introduce ECHO, an evaluative framework inspired by the Turing test. This framework engages the acquaintances of the target individuals to distinguish between human and machine-generated responses. Notably, our framework focuses on emulating average individuals rather than historical or fictional figures, presenting a unique advantage to apply the Turing Test. We evaluated three role-playing LLMs using ECHO, with GPT-3.5 and GPT-4 serving as foundational models, alongside the online application GPTs from OpenAI. Our results demonstrate that GPT-4 more effectively deceives human evaluators, and GPTs achieves a leading success rate of 48.3%. Furthermore, we investigated whether LLMs could discern between human-generated and machine-generated texts. While GPT-4 can identify differences, it could not determine which texts were human-produced. Our code and results of reproducing the role-playing LLMs are made publicly available via https://github.com/CUHK-ARISE/ECHO.

研究の動機と目的

  • 有名人やフィクションの登場人物ではなく、一般の人々を模倣するLLMの能力を評価するというギャップを埋めるため。
  • 実際の人物のプロフィールを用いて、チューリングテストに基づくLLMのロールプレイシナリオ評価を可能にするフレームワークの開発。
  • LLMが人間が書いたテキストと機械生成テキストを区別できるかどうかを評価し、その判断に潜在するバイアスを同定すること。
  • 参加者のプライバシーを保護し、同意を得ることで、倫理的なデータ取り扱いを確保すること。
  • 実際の個人データを用いたロールプレイLLMの再現可能なベンチマークを提供すること。

提案手法

  • ECHOは、年齢、趣味、コミュニケーションスタイルを含む10人の実際の個人の背景データを用いて、ロールプレイ用LLMを構築する。
  • ターゲット個人の知人である人間の評価者に、実際にその人物が書いたものか、LLMが生成したものかを特定するタスクを課す。
  • 4つのロールプレイ手法(RoleGPT、Juliet、Role-Play Prompting(RPP)、OpenAIのGPTs)を比較し、GPT-3.5-TurboとGPT-4-Turboを基盤モデルとして用いる。
  • 個人の歴史、好み、現在の状況といった分野にまたがる10種類の質問を用いて、本物らしさと整合性をテストする。
  • 制御実験として、GPT-4 や Gemini-Pro が人間生成と機械生成のテキストを区別できるかどうかを評価し、バイアスと正確性を測定する。
  • すべての個人データはローカルで処理され、第三者と共有されず、6か月後にすべての応答が削除され、プライバシー保護を確保する。

実験結果

リサーチクエスチョン

  • RQ1人間の評価者が本物の応答と合成された応答を区別できるかどうかを測定することで、LLMが一般の人々を効果的に模倣できるか。
  • RQ2GPTs、RoleGPT、RPPなどの異なるロールプレイ手法が、ターゲット個人の知人をだます能力においてどのように異なるか。
  • RQ3LLMは、与えられたテキストが人間が書いたものか、別のLLMが生成したものかを正確に識別できるか。また、その判断にバイアスを示すか。
  • RQ4モデルの類似性やテキスト長さの観点から、LLMが人間生成テキストと機械生成テキストを評価する際の固有のバイアスは何か。
  • RQ5LLMが感情の深さ、文化的文脈、特徴的なコミュニケーションパターンといった、繊細な人間らしさをどれほど正確に再現できないか。

主な発見

  • GPTsは、全ロールプレイ手法において48.3%の最高の欺瞞成功率を達成し、GPT-3.5やGPT-4を上回った。
  • GPT-4はGPT-3.5に比べて優れたロールプレイ能力を示し、テストされたモデルの中でより高い欺瞞率を記録した。
  • GPT-4とGPT-4-Turboの両方が、機械生成テキストと人間生成テキストを区別する際、90%を超える成功を収めた。これは、強い検出能力を示している。
  • 強力な検出性能にもかかわらず、GPT-4は人間が書いたテキストを信頼して特定できず、自ら生成するパターンにバイアスを示している可能性がある。
  • GPT-4は顕著な指示バイアスを示し、設定ごとの正確性に63.5%の差が生じた。これは、機械生成コンテンツを識別する際の自信が、人間生成コンテンツの識別よりも高いことを示している。
  • 制御モデルとの比較により、LLMが人間生成と機械生成テキストを区別する能力に顕著な長さバイアスは観察されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。