Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring The Design of Prompts For Applying GPT-3 based Chatbots: A Mental Wellbeing Case Study on Mechanical Turk

Harsh Kumar, Ilya Musabirov|arXiv (Cornell University)|2022. 09. 22.
AI in Service Interactions인용 수 27
한 줄 요약

논문은 랜덤화된 팩토리얼 실험(N=945)을 통해 프롬프트 설계(정체성, 의도, 행동)가 mood 지원용 GPT-3 기반 챗봇에 어떤 영향을 주는지 양적 평가 및 질적 대화 분석으로 연구한다.

ABSTRACT

Large-Language Models like GPT-3 have the potential to enable HCI designers and researchers to create more human-like and helpful chatbots for specific applications. But evaluating the feasibility of these chatbots and designing prompts that optimize GPT-3 for a specific task is challenging. We present a case study in tackling these questions, applying GPT-3 to a brief 5-minute chatbot that anyone can talk to better manage their mood. We report a randomized factorial experiment with 945 participants on Mechanical Turk that tests three dimensions of prompt design to initialize the chatbot (identity, intent, and behaviour), and present both quantitative and qualitative analyses of conversations and user perceptions of the chatbot. We hope other HCI designers and researchers can build on this case study, for other applications of GPT-3 based chatbots to specific tasks, and build on and extend the methods we use for prompt design, and evaluation of the prompt design.

연구 동기 및 목표

  • 통제된 설정에서 짧은 기분 관리 태스크를 위한 GPT-3 챗봇의 가능성 탐색.
  • 프롬프트 수정자(정체성, 의도, 행동)가 사용자 인식과 대화 역학을 형성하는 방식 조사.
  • HCI에서 프롬프트 설계 탐색 및 평가를 위한 방법론적 프레임워크 제공.
  • 파일럿 연구보다 큰 규모의 데이터 수집 및 분석 방법(정량적 설문 및 질적 로그) 제시.

제안 방법

  • 정체성, 의도, 행동 수정자를 결합한 18개의 프롬프트 팔을 테스트하기 위해 2 x 3 x 3 팩토리얼 실험 설계 사용.
  • 제어된 상호작용 길이와 AI임을 공개하는 945명의 MTurk 참가자에게 5분 간의 자유로운 기분 지원 챗봇 배포.
  • 지각 위험, 신뢰, 전문성, 재상호작용 의향의 측정 및 질적 분석을 위한 대화 로그 수집.
  • 참가자 코멘트의 질적 주제 분석 수행 및 프롬프트 조건 간 대화 역학 검토.
  • 반응의 이질성 이해를 위한 인구통계학 및 기술 친화성 변수 분석(예: 과거 정신건강 도움, 기술 성향).
  • 복제 및 추가 프롬프트 엔지니어링 연구를 가능하게 하는 오픈 소스 챗 인터페이스 및 방법론 제공.

실험 결과

연구 질문

  • RQ1다양한 프롬프트 수정자(정체성, 의도, 행동)가 GPT-3 기반 챗봇에 대한 위험 인식, 신뢰, 전문성 인식, 재상호작용 의향에 어떤 영향을 미치는가?
  • RQ2다양한 프롬프트 설정에서 5분 대화에서 나타나는 질적 패턴은 어떤가?
  • RQ3인구통계학 요인이나 과거 정신건강 도움 이력이 프롬프트 설계가 다른 GPT-3 챗봇에 대한 반응을 조절하는가?
  • RQ4팩토리얼 프롬프트 설계가 주된 효과나 상호작용을 드러내어 작업 특화 챗봇의 프롬프트 엔지니어링에 도움이 되는가?

주요 결과

  • 참가자들은 중간 정도의 높은 위험 인식, 중간 수준의 신뢰, 높은 전문성 인식, 그리고 재상호작용 의향을 보였다.
  • 과거의 정신건강 도움 이력은 네 가지 평가 차원 모두에 유의미한 영향을 미쳤으며, 더 높은 위험, 낮은 신뢰, 비슷한 전문성, 더 높은 재상호작용 의향을 보였다.
  • 기술에 대한 더 우호적인 태도는 보통 더 높은 위험 인식, 낮은 신뢰, 더 높은 전문성, 더 높은 재상호작용 의향과 연관되었다.
  • 질적 주제는 일반적으로 긍정적 상호작용(약 70%)을 나타냈고, 데이터 프라이버시 우려가 주요 부정 주제로 약 30%를 차지했다.
  • Friend 대 Coach 정체성은 대화 역학에 명확한 질적/양적 경향을 보이지 않았지만, Friend가 이용자 응답을 약간 더 길게 이끄는 경향이 있었다; Intent는 Identity나 Behavior보다 단어 수에 더 영향을 미치는 것으로 보인다.
  • CBT 및 문제해결 의도는 더 길고 지시적 대화를 유도하는 경향이 있었고, Open-Ended 반성 프롬프트는 때때로 짧은 교환을 낳았으며, 전반적으로 대화 역학은 의도 구현에 따라 달랐다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.