Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Users' Dissatisfaction with ChatGPT Responses: Types, Resolving Tactics, and the Effect of Knowledge Level

Yoonsu Kim, J. K.W. Lee|arXiv (Cornell University)|2023. 11. 13.
Artificial Intelligence in Healthcare and Education참고 문헌 88인용 수 4
한 줄 요약

이 연구는 107명의 사용자로부터 확득한 511건의 불만족스러운 상호작용을 분석하여 챗지피티 응답에 대한 사용자 불만을 혼합 방법으로 조사한다. 불만족 유형을 일곱 가지로 분류하였으며, 의도 오해가 가장 흔하고 정확성 문제는 가장 심각한 것으로 나타났다. 또한 사용자들이 의도의 구체화 같은 전략을 사용하고 있음에도 불구하고 72%의 불만족은 해결되지 않은 채로 남아 있어, 현재의 사용자 전략에 심각한 한계가 있음을 시사한다. 지식 수준은 불만족 패턴과 해결 노력에 큰 영향을 미치며, 낮은 지식 수준의 사용자는 정확성 문제를 더 자주 겪고 전략을 더 적게 사용한다.

ABSTRACT

Large language models (LLMs) with chat-based capabilities, such as ChatGPT, are widely used in various workflows. However, due to a limited understanding of these large-scale models, users struggle to use this technology and experience different kinds of dissatisfaction. Researchers have introduced several methods, such as prompt engineering, to improve model responses. However, they focus on enhancing the model's performance in specific tasks, and little has been investigated on how to deal with the user dissatisfaction resulting from the model's responses. Therefore, with ChatGPT as the case study, we examine users' dissatisfaction along with their strategies to address the dissatisfaction. After organizing users' dissatisfaction with LLM into seven categories based on a literature review, we collected 511 instances of dissatisfactory ChatGPT responses from 107 users and their detailed recollections of dissatisfactory experiences, which we released as a publicly accessible dataset. Our analysis reveals that users most frequently experience dissatisfaction when ChatGPT fails to grasp their intentions, while they rate the severity of dissatisfaction related to accuracy the highest. We also identified four tactics users employ to address their dissatisfaction and their effectiveness. We found that users often do not use any tactics to address their dissatisfaction, and even when using tactics, 72% of dissatisfaction remained unresolved. Moreover, we found that users with low knowledge of LLMs tend to face more dissatisfaction on accuracy while they often put minimal effort in addressing dissatisfaction. Based on these findings, we propose design implications for minimizing user dissatisfaction and enhancing the usability of chat-based LLM.

연구 동기 및 목표

  • 채팅 기반 LLM(예: 챗지피티)을 사용할 때 사용자가 겪는 불만족 유형을 이해하기 위해.
  • 지속적인 대화 중 불만족을 해결하기 위한 사용자 전략을 식별하고 평가하기 위해.
  • 사용자의 LLM에 대한 지식 수준이 불만족과 해결 행동에 어떻게 영향을 미치는지 분석하기 위해.
  • 채팅 기반 LLM 서비스의 사용성과 사용자 경험 향상을 위한 설계 시사점을 제공하기 위해.

제안 방법

  • LLM 응답 실패 기반으로 사용자 측 불만을 일곱 가지 유형으로 분류하기 위해 체계적 문헌 고찰을 수행하였다.
  • 실제 511건의 불만족스러운 챗지피티 상호작용(107명의 사용자로부터 확득)을 수집하고 분석하였으며, 상세한 기억 회상과 대화 로그를 포함하였다.
  • 정성적 분 析를 통해 사용자 응답 전략을 네 가지 범주로 분류: 의도의 구체화, 어조 재구성, 명확화 요청, 프롬프트 재사용.
  • 자기 보고된 사용자 점수를 사용하여 불만족 심각도와 전략 효과성을 측정하였으며, 실제 대화 로그와의 일치성을 검증하였다.
  • 지식 수준(고지식 vs. 저지식)에 따라 사용자를 분할하여 불만족 빈도, 심각도, 해결 행동의 차이를 분석하였다.
  • 향후 연구를 위해 사용자 보고 기반의 불만족 사례 데이터셋을 공개하였다.

실험 결과

연구 질문

  • RQ1사용자가 챗지피티 응답과 상호작용할 때 겪는 주요 불만족 유형은 무엇인가?
  • RQ2사용자는 어떤 전략을 사용하여 불만족을 해결하려고 하는가? 이러한 전략의 효과는 어떠한가?
  • RQ3사용자의 LLM에 대한 지식 수준은 불만족의 빈도, 심각도, 해결에 어떻게 영향을 미치는가?
  • RQ4사용자 경험에서 가장 흔하고 가장 심각한 불만족 유형은 무엇인가?

주요 결과

  • 가장 흔한 불만족 유형은 '의도 이해 실패'였으며, 이는 챗지피티가 사용자의 의도한 요청을 파악하지 못했을 때 발생했다.
  • 가장 심각한 불만족은 '정보 정확성 문제'와 연관되어 있었으며, 이는 응답에 사실 오류나 환각( hallucinations)이 포함되었을 때 발생했다.
  • 전략을 사용하고도 72%의 불만족 사례가 해결되지 않아 현재의 사용자 전략에 심각한 한계가 있음을 시사한다.
  • 의도의 구체화는 가장 자주 사용되었고, 동시에 가장 효과적인 해결 전략이었다.
  • LLM에 대해 낮은 지식 수준을 가진 사용자는 정확성과 내용의 깊이와 관련된 불만족을 더 자주 겪었으며, 어떤 해결 전략도 사용할 가능성이 낮았다.
  • 저지식 사용자는 거부 응답(D_refuse)을 더 자주 만났고, 수정 없이 동일한 프롬프트를 반복적으로 재사용하는 경향이 있어 효과적인 적응 전략 부족을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.