[論文レビュー] Exploring The Design of Prompts For Applying GPT-3 based Chatbots: A Mental Wellbeing Case Study on Mechanical Turk
この論文は、プロンプト設計(アイデンティティ、意図、挙動)が mood-support のための GPT-3 ベースのチャットボットにどのように影響するかを、定量評価と定性的な会話分析の双方で検討する、ランダム化因子実験(N=945)を実施しています。
Large-Language Models like GPT-3 have the potential to enable HCI designers and researchers to create more human-like and helpful chatbots for specific applications. But evaluating the feasibility of these chatbots and designing prompts that optimize GPT-3 for a specific task is challenging. We present a case study in tackling these questions, applying GPT-3 to a brief 5-minute chatbot that anyone can talk to better manage their mood. We report a randomized factorial experiment with 945 participants on Mechanical Turk that tests three dimensions of prompt design to initialize the chatbot (identity, intent, and behaviour), and present both quantitative and qualitative analyses of conversations and user perceptions of the chatbot. We hope other HCI designers and researchers can build on this case study, for other applications of GPT-3 based chatbots to specific tasks, and build on and extend the methods we use for prompt design, and evaluation of the prompt design.
研究の動機と目的
- GPT-3 チャットボットを用いた簡易な気分管理タスクの実現可能性を制御された環境で検討する。
- プロンプト修飾子(アイデンティティ、意図、挙動)がユーザーの認識と会話のダイナミクスをどう形作るかを調査する。
- HCI におけるプロンプト設計の探索と評価の方法論的フレームワークを提供する。
- パイロット研究より大規模なデータ収集と分析手法(定量的調査と定性的ログ)を示す。
提案手法
- 因子設計 (2 x 3 x 3) を用いて、アイデンティティ、意図、挙動修飾子を組み合わせた 18 通りのプロンプトArm を検証する。
- 945 名の MTurk 参加者に対して、制御された対話長と AI であることの開示を行い、5 分間のオープンエンドの気分サポートチャットボットを展開する。
- 知覚リスク、信頼、専門性、再対話意欲の測定値と、定性的分析のための会話ログを収集する。
- 参加者のコメントの定性的主題分析を実施し、プロンプト条件間での会話ダイナミクスを調べる。
- 前提となるデモグラフィックおよび技術嗜好変数を分析し、回答の異質性を理解する(例:過去の精神保健支援、技術親和性)。
- 再現性とさらなるプロンプト工学研究を可能にするオープンソースのチャットインターフェースと方法論を提供する。
実験結果
リサーチクエスチョン
- RQ1異なるプロンプト修飾子(アイデンティティ、意図、挙動)は、GPT-3 ベースのチャットボットに対するリスク認識、信頼、専門性、再対話意欲のユーザー認識にどのような影響を与えるか。
- RQ25 分間の会話で、異なるプロンプト設定下の GPT-3 チャットボットを用いた mood management でどんな定性的パターンが現れるか。
- RQ3デモグラフィック要因や過去の精神健康支援履歴は、異なるプロンプト設計下の GPT-3 チャットボットへの回答を調整するか。
- RQ4因子設計によるプロンプト設計が、タスク特化型チャットボットのより良いプロンプト工学を導く主効果や交互作用を明らかにできるか。
主な発見
- 参加者は中程度に高いリスク認識、適度な信頼、高い専門性の認識、再対話意欲を示した。
- 過去の精神保健支援の履歴は、4つの評価次元すべてに有意な影響を与え、リスクが高く、信頼が低く、専門性はほぼ同等で、再対話意欲が高くなる傾向を示した。
- 技術に対する好意的な態度は、リスク認識の増大、信頼の低下、専門性の増加、再対話意欲の増大と関連する傾向があった。
- 定性的分析の主題は、全体的にポジティブな相互作用が約70%を占め、データプライバシーの懸念が主要なネガティブ主題として約30%を占めた。
- Friend よりも Coach アイデンティティは、会話ダイナミクスに明確な定性的/定量的傾向を示さなかったが、Friend はユーザー回答をやや長く引き出す傾向があった。Intent は Identity や Behavior よりも語数に影響を与えるようだった。
- CBT および Problem-Solving の意図は、より長く、より指示的な会話を生む傾向があり、Open-Ended の反映プロンプトは時に短いやり取りを生んだことがあり、全体としては意図実装によって対話ダイナミクスが異なっていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。