[論文レビュー] Prompting and Evaluating Large Language Models for Proactive Dialogues: Clarification, Target-guided, and Non-collaboration
本稿では、大規模言語モデル(LLMs)の能動的対話システムにおける性能向上を目的として、Clarification Questionの生成、目標指向の会話誘導、戦略的交渉を可能にするProactive Chain-of-Thought(ProCoT)プロンプトを提案する。ProCoTはLLMsの計画立案および能動的行動の促進を改善するが、分野特異的および戦略的交渉タスクでは性能が限定的である。
Conversational systems based on Large Language Models (LLMs), such as ChatGPT, show exceptional proficiency in context understanding and response generation. However, despite their impressive capabilities, they still possess limitations, such as providing randomly-guessed answers to ambiguous queries or failing to refuse users' requests, both of which are considered aspects of a conversational agent's proactivity. This raises the question of whether LLM-based conversational systems are equipped to handle proactive dialogue problems. In this work, we conduct a comprehensive analysis of LLM-based conversational systems, specifically focusing on three aspects of proactive dialogue systems: clarification, target-guided, and non-collaborative dialogues. To trigger the proactivity of LLMs, we propose the Proactive Chain-of-Thought prompting scheme, which augments LLMs with the goal planning capability over descriptive reasoning chains. Empirical findings are discussed to promote future studies on LLM-based proactive dialogue systems.
研究の動機と目的
- LLMを用いた会話エージェントが、Clarification、目標指向会話、非協力的交渉といった能動的対話タスクを効果的に行えるかどうかを調査すること。
- 強力な応答生成能力を有する一方で、Clarification質問の発起や戦略的応答の計画といった行動の自発的発現が不十分であるLLMsのギャップを埋めること。
- LLMsが能動的行動をとるための推論と目標計画を誘発する、新しいプロンプティング方式「Proactive Chain-of-Thought(ProCoT)」の設計および評価。
- 3つの能動的対話シナリオにおいて、LLMベースのシステムとファインチューニング済みSOTA対話モデルを比較し、性能と限界を評価すること。
提案手法
- LLMsが行動をとる前に記述的推論チェーンを生成するよう指示する、Proactive Chain-of-Thought(ProCoT)プロンプティングを提案する。
- ProCoTを3段階に構造化する:(1) 会話の目的に向けた中間ステップの推論、(2) 次の行動の意思決定、(3) 決定に基づいた応答の生成。
- 3つのプロンプティング方式を実装する:標準プロンプティング(直接応答)、能動的プロンプティング(会話行動オプション付き)、ProCoT(推論と計画ステップ付き)。
- 3つの会話タイプ—情報抽出におけるClarification、目標指向のオープンドメイン会話、非協力的交渉会話—を対象に、ChatGPTおよびVicuna 13Bの2つのLLMを評価する。
- 交渉の効果性および戦略的意思決定の評価に、自動化された指標(Sale-to-List Ratio、会話行動の正確性)を用いる。
- モデル行動の定性的および定量的分析(戦略分布、交渉行動における誤りパターン)を実施する。

実験結果
リサーチクエスチョン
- RQ1ChatGPT や Vicuna といったLLMsは、曖昧なユーザークエリに直面した際に、自発的にClarification質問を発することができるか?
- RQ2LLMsは、事前に指定されたターゲットトピックに向けてオープンドメイン会話をどれほど効果的に誘導できるか。また、トピック遷移はどれほど滑らかに行えるか?
- RQ3非協力的交渉会話において、LLMsは戦略的で譲歩しない意思決定を下せるか。それとも、譲歩的行動に傾倒するか?
- RQ4Proactive Chain-of-Thought(ProCoT)プロンプティング方式は、3つの会話タイプにおいてLLMsの計画立案および能動的行動をどれほど効果的に改善できるか?
- RQ5LLMsが能動的対話において、特に分野特異的または高リスクの交渉状況において、主な失敗モードや限界は何か?
主な発見
- 標準プロンプティングを用いたLLMsは、曖昧なクエリに直面しても、ほとんどClarification質問を発しないことが判明し、情報抽出会話における能動的行動が著しく低いことが示された。
- ProCoTはClarification質問の発生率を顕著に向上させたが、分野特異的応用では依然として性能が不十分である。
- LLMsはターゲットトピックへの攻撃的で不自然なトピック移行を示す傾向があるが、ProCoTにより計画的推論を通じてより滑らかで戦略的な移行が可能になった。
- 非協力的交渉において、LLMsは「hedge words」の使用や即時受諾といった譲歩的戦略に傾き、Sale-to-List Ratioが低くなる傾向を示した。
- ProCoTは反提案の提案を促進することで、交渉における戦略的意思決定を改善したが、自己利益最大化のための強力な計画能力は依然として欠如している。
- 制御された応答生成において優れた性能を発揮する一方で、LLMsは動的かつ相互作用的な対話環境における長期的戦略的計画および目的指向行動に苦労している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。