Skip to main content
QUICK REVIEW

[논문 리뷰] User Intent Recognition and Satisfaction with Large Language Models: A User Study with ChatGPT

Anna Bodonhelyi, Efe Bozkir|arXiv (Cornell University)|2024. 02. 03.
Topic Modeling인용 수 4
한 줄 요약

이 사용자 연구는 세분화된 의도 분류 체계와 프롬프트 재구성 전략을 적용하여 GPT-3.5 Turbo와 GPT-4 Turbo의 의도 인식 및 만족도를 평가한다. 결과적으로 GPT-4는 일반적인 의도에서는 GPT-3.5를 능가하지만 희귀한 의도에서는 뒤지며, 의도 인식이 향상된 것으로도 불구하고 사용자들은 재구성된 프롬프트보다 원본 프롬프트를 선호한다. 이는 모델 정확도와 사용자 만족도 사이에 괴리가 있음을 시사한다.

ABSTRACT

The rapid evolution of LLMs represents an impactful paradigm shift in digital interaction and content engagement. While they encode vast amounts of human-generated knowledge and excel in processing diverse data types, they often face the challenge of accurately responding to specific user intents, leading to user dissatisfaction. Based on a fine-grained intent taxonomy and intent-based prompt reformulations, we analyze the quality of intent recognition and user satisfaction with answers from intent-based prompt reformulations of GPT-3.5 Turbo and GPT-4 Turbo models. Our study highlights the importance of human-AI interaction and underscores the need for interdisciplinary approaches to improve conversational AI systems. We show that GPT-4 outperforms GPT-3.5 in recognizing common intents but is often outperformed by GPT-3.5 in recognizing less frequent intents. Moreover, whenever the user intent is correctly recognized, while users are more satisfied with the intent-based reformulations of GPT-4 compared to GPT-3.5, they tend to be more satisfied with the models' answers to their original prompts compared to the reformulated ones. The collected data from our study has been made publicly available on GitHub (https://github.com/ConcealedIDentity/UserIntentStudy) for further research.

연구 동기 및 목표

  • 실제 프롬프트에서 GPT-3.5 Turbo와 GPT-4 Turbo가 다양한 사용자 의도를 얼마나 잘 인식하는지 조사하기 위해.
  • 의도 기반 프롬프트 재구성 전략이 LLM 응답에 대한 사용자 만족도에 어떤 영향을 미치는지 평가하기 위해.
  • 일반적이고 희귀한 의도 카테고리 간 모델 간 성능 격차를 규명하기 위해.
  • 특히 응답 품질에 대한 인식을 고려할 때, 사용자들이 원본 프롬프트와 재구성된 프롬프트 중 어느 쪽을 선호하는지 탐색하기 위해.
  • 의도 이해와 사용자 상호작용 설계의 격차를 밝혀 향후 LLM 개발에 기여하기 위해.

제안 방법

  • 정보 검색 및 최신 NLP 연구를 바탕으로 세분화된 의도 분류 체계를 개발하여, 사실 정보 질의, 설명 요청, 콘텐츠 생성 등의 구체적인 의도 유형으로 사용자 의도를 분류하였다.
  • 실제 사용자 프롬프트를 수집하고, 분류 체계에서 유도된 템플릿을 활용해 의도 기반 프롬프트 재구성을 수행하여 명확성과 구체성을 향상시켰다.
  • 원본 및 재구성된 프롬프트를 사용하여 GPT-3.5와 GPT-4가 다양한 의도 카테고리에서 작동하는 제어된 사용자 연구를 실시하였다.
  • 모델 응답이 사전 정의된 의도 레이블과 일치하는 정도를 측정하여 의도 인식 정확도를 평가하고, 사후 상호작용 설문지를 통해 사용자 만족도를 측정하였다.
  • 사실 정보 질의에 대해서는 사실 확인을 지원하고 사용자 검증을 가능하게 하기 위해 재구성된 프롬프트에 참고 자료를 통합하였다.
  • 원본 프롬프트와 재구성된 프롬프트 응답 간 비교 평가를 통해 사용자 선호도와 만족도 수준을 분석하였다.
Figure 1: Overview of the proposed prompt reformulation framework, visual summary of Algorithm 1 .
Figure 1: Overview of the proposed prompt reformulation framework, visual summary of Algorithm 1 .

실험 결과

연구 질문

  • RQ1GPT-3.5 Turbo와 GPT-4 Turbo는 일반적이고 희귀한 사용자 의도 인식에서 어떻게 비교되는가?
  • RQ2의도 기반 프롬프트 재구성 전략은 LLM 응답에 대한 사용자 만족도를 어느 정도 향상시키는가?
  • RQ3GPT-4에서 향상된 의도 인식은 GPT-3.5보다 더 높은 사용자 만족도로 이어지는가?
  • RQ4왜 의도 인식이 향상된 재구성된 프롬프트일지라도 사용자들은 원본 프롬프트의 응답을 선호하는가?
  • RQ5재구성된 프롬프트에 참고 자료가 포함될 경우 사용자 신뢰도와 만족도에 어떤 영향을 미치는가?

주요 결과

  • GPT-4 Turbo는 사실 정보 질의, 설명 요청, 콘텐츠 생성 등의 일반적 의도 카테고리에서 GPT-3.5 Turbo보다 유의미하게 높은 의도 인식 정확도를 보였다.
  • 희귀한 의도 카테고리인 '커리큘럼 기획'과 '학습 지원'에 대해서는 GPT-3.5 Turbo가 GPT-4 Turbo를 능가하여, 모델이 저빈도 의도를 처리하는 데에 한계가 있음을 시사한다.
  • 의도 인식 정확도가 높아졌음에도 불구하고, 두 모델 모두 사용자들이 재구성된 프롬프트보다 원본 프롬프트의 응답을 일관되게 선호하였다.
  • GPT-4의 원본 프롬프트 응답에 대한 사용자 만족도가 GPT-3.5의 재구성된 프롬프트 응답보다 더 높았으며, 이는 GPT-3.5가 재구성된 프롬프트에 대해 더 높은 만족도 점수를 받았음에도 불구하고 동일한 경향을 보였다.
  • 사실 확인을 위한 참고 자료가 포함된 재구성된 프롬프트일지라도 사용자들은 자연스럽고 유창한 표현을 더 선호하여, 자연스러움과 유창성에 대한 가치가 체계적인 명확성보다 더 중요하다는 점이 드러났다.
  • 재구성 템플릿을 제공받은 사용자들은 프롬프트 구성 기술을 빠르게 습득하여, 효과적인 프롬프트 작성 교육의 잠재력이 있음을 보여주었다.
(a) Confusion matrix for GPT-3.5.
(a) Confusion matrix for GPT-3.5.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.