Skip to main content
QUICK REVIEW

[論文レビュー] User Intent Recognition and Satisfaction with Large Language Models: A User Study with ChatGPT

Anna Bodonhelyi, Efe Bozkir|arXiv (Cornell University)|Feb 3, 2024
Topic Modeling被引用数 4
ひとこと要約

本研究では、細分化された意図分類とプロンプト再構成戦略を用いて、GPT-3.5 TurboとGPT-4 Turboにおける意図認識と満足度を評価するユーザースタディを実施した。結果として、GPT-4は一般的な意図ではGPT-3.5を上回るが、レアな意図では逆に劣る。ユーザーは意図認識の向上にもかかわらず、再構成されたプロンプトよりも元のプロンプトを好むことが明らかになった。これは、モデルの正確性とユーザー満足度の間に乖離が生じていることを示唆している。

ABSTRACT

The rapid evolution of LLMs represents an impactful paradigm shift in digital interaction and content engagement. While they encode vast amounts of human-generated knowledge and excel in processing diverse data types, they often face the challenge of accurately responding to specific user intents, leading to user dissatisfaction. Based on a fine-grained intent taxonomy and intent-based prompt reformulations, we analyze the quality of intent recognition and user satisfaction with answers from intent-based prompt reformulations of GPT-3.5 Turbo and GPT-4 Turbo models. Our study highlights the importance of human-AI interaction and underscores the need for interdisciplinary approaches to improve conversational AI systems. We show that GPT-4 outperforms GPT-3.5 in recognizing common intents but is often outperformed by GPT-3.5 in recognizing less frequent intents. Moreover, whenever the user intent is correctly recognized, while users are more satisfied with the intent-based reformulations of GPT-4 compared to GPT-3.5, they tend to be more satisfied with the models' answers to their original prompts compared to the reformulated ones. The collected data from our study has been made publicly available on GitHub (https://github.com/ConcealedIDentity/UserIntentStudy) for further research.

研究の動機と目的

  • GPT-3.5 TurboとGPT-4 Turboが現実世界のプロンプトにおける多様なユーザーの意図をどれほど正しく認識できるかを調査すること。
  • 意図ベースのプロンプト再構成が、LLMによる応答に対するユーザー満足度に与える影響を評価すること。
  • 一般的な意図とレアな意図のカテゴリ間でモデル間のパフォーマンス差を特定すること。
  • 特に応答品質の認識された質に関して、元のプロンプトと再構成されたプロンプトの間でのユーザーの好みを調査すること。
  • 意図理解のギャップとユーザーインタラクション設計の観点から、今後のLLM開発を支援する情報の特定

提案手法

  • 情報検索および最近のNLP研究に基づいて、事実的質問、説明的質問、コンテンツ作成などの明確なタイプに分類される細分化された意図分類を構築した。
  • 実際のユーザーのプロンプトを収集し、分類に基づくテンプレートを用いて意図に特化したプロンプト再構成を実施し、明確さと具体的さを向上させた。
  • GPT-3.5とGPT-4の両方を用いて、さまざまな意図カテゴリにおける元のプロンプトと再構成済みプロンプトにインタラクトする制御されたユーザースタディを実施した。
  • モデルの応答が事前に定義された意図ラベルと一致するかどうかを測定することで意図認識の正確性を評価し、インタラクション後のアンケートを通じてユーザー満足度を測定した。
  • 事実的質問に対しては、信頼性を高め、ユーザーによる検証を支援するため、再構成済みプロンプトに事実確認の根拠を組み込んだ。
  • 元のプロンプトと再構成済みプロンプトの応答を比較して評価することで、ユーザーの好みと満足度レベルを分析した。
Figure 1: Overview of the proposed prompt reformulation framework, visual summary of Algorithm 1 .
Figure 1: Overview of the proposed prompt reformulation framework, visual summary of Algorithm 1 .

実験結果

リサーチクエスチョン

  • RQ1GPT-3.5 TurboとGPT-4 Turboは、一般的な意図とレアな意図の両方をどれほど正しく認識できるか?
  • RQ2意図ベースのプロンプト再構成は、LLMの応答に対するユーザー満足度をどの程度向上させるか?
  • RQ3GPT-4の意図認識の向上は、GPT-3.5よりも高いユーザー満足度をもたらすか?
  • RQ4なぜ、再構成により意図認識が向上しても、ユーザーは再構成済みプロンプトよりも元のプロンプトの応答を好むのか?
  • RQ5再構成済みプロンプトに根拠が含まれていると、ユーザーの信頼性と満足度にどのような影響を与えるか?

主な発見

  • GPT-4 Turboは、事実的質問、説明的質問、コンテンツ作成などの一般的な意図カテゴリにおいて、GPT-3.5 Turboよりも顕著に高い意図認識正確性を示した。
  • 「カリキュラム計画」や「学習支援」のようなレアな意図カテゴリでは、GPT-3.5 TurboがGPT-4 Turboを上回った。これは、モデルが低頻度の意図を処理する能力に限界があることを示している。
  • 高い意図認識正確性にもかかわらず、両モデルにおいてもユーザーは再構成済みプロンプトの応答よりも元のプロンプトの応答を一貫して好んだ。
  • GPT-3.5が再構成済みプロンプトに対しては高い満足度スコアを得たにもかかわらず、GPT-4の元のプロンプトに対する応答はGPT-3.5のそれよりもユーザー満足度が高かった。
  • 事実確認の根拠を含む再構成済みプロンプトであっても、ユーザーは自然な流れや滑らかさを重視し、再構成されたプロンプトの応答を好まない傾向が続いた。
  • 再構成テンプレートが提供された場合、ユーザーはプロンプトの作成において迅速に学習を進め、効果的なプロンプト作成の教育的活用の可能性が示された。
(a) Confusion matrix for GPT-3.5.
(a) Confusion matrix for GPT-3.5.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。