[論文レビュー] Leveraging Large Language Models to Power Chatbots for Collecting User Self-Reported Data
この論文は、GPT-3搭載のチャットボットのゼロショットプロンプトが自己申告の健康データを収集できるかを研究し、プロンプト構造と人格の手がかりがデータ収集と会話スタイルにどう影響するかを評価します。
Large language models (LLMs) provide a new way to build chatbots by accepting natural language prompts. Yet, it is unclear how to design prompts to power chatbots to carry on naturalistic conversations while pursuing a given goal, such as collecting self-report data from users. We explore what design factors of prompts can help steer chatbots to talk naturally and collect data reliably. To this aim, we formulated four prompt designs with different structures and personas. Through an online study (N = 48) where participants conversed with chatbots driven by different designs of prompts, we assessed how prompt designs and conversation topics affected the conversation flows and users' perceptions of chatbots. Our chatbots covered 79% of the desired information slots during conversations, and the designs of prompts and topics significantly influenced the conversation flows and the data collection performance. We discuss the opportunities and challenges of building chatbots with LLMs.
研究の動機と目的
- プロンプト設計要因が健康トピックを横断してユーザー自己申告データを収集するためのLLM駆動チャットボットに与える影響を探る。
- ファインチューニングなしでGPT-3搭載のチャットボットのスロット充填性能と会話スタイルを評価する。
- LLMベースのチャットボットとの堅牢で自然な対話およびデータ収集のための設計ガイドラインを特定する。
提案手法
- 構造化情報スロットと記述的情報スロットプロンプトを用いて、16台のGPT-3搭載チャットボットを実装する(4トピック×2形式×2人格)。
- uniformな生成パラメータ(temperature 0.9、presence penalty 0.6、frequency penalty 0.5)でdavinci-text-002を使用。
- Webベースのチャットインターフェースを提供し、4つの健康トピックにわたる被験者間オンライン研究を実施する(N=48)。
- 事前定義された情報スロットが取得されたかどうかを手動でコーディングしてスロット充填を評価する。
- 対話行為をコード化して会話の流れとチャットボットの挙動を特徴づける。
- 参加者の退出アンケートを分析して、チャットボットの共感性と理解度を測る。

実験結果
リサーチクエスチョン
- RQ1情報フォーマットと人格修飾プロンプトがLLM駆動チャットボットのスロット充填性能にどのように影響するか。
- RQ2GPT-3搭載のチャットボットは自己申告データ収集の会話で文脈を維持し、共感を示すか。
- RQ3タスク志向のチャットボット対話におけるプロンプト設計が会話の流れとユーザーの認識に与える影響は何か。
主な発見
- ゼロショットプロンプトを用いた対話全体で、チャットボットは望まれる情報スロットの79%をカバーした。
- 情報フォーマットと人格修飾といったプロンプト設計要因が会話の流れとデータ収集性能に有意な影響を与えた。
- チャットボットは一般的に共感的に応答し、参加者は回答の正確さと有用性を高く認識する場面があった。
- ファインチューニングなしで自己申告データの収集と文脈保持・状態追跡が可能であることを示す。
- 二つのプロンプト設計要因の体系的な検討は、LLMsを用いたドメイン特化のゼロショットチャットボットの構築に対する洞察を提供する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。