Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

Huachuan Qiu, Zhenzhong Lan|arXiv (Cornell University)|2024. 08. 28.
Artificial Intelligence in Law인용 수 4
한 줄 요약

이 논문은 두 개의 GPT-4 모델을 사용하여 상담사-고객 심리 상담을 시뮬레이션하는 역할 수행 기반 LLM-to-LLM 프레임워크를 제안한다. 하나는 실제 생활 프로필을 가진 고객으로 설정되고, 다른 하나는 통합 치료 기법을 숙련한 상담사로 설정된다. 이 방법은 인간 상호작용과 유사한 고도로 사실적인 대화를 생성하며, 개인정보를 보호하는 방식으로 작동하여 대화 품질과 상담사 행동 유사도 측면에서 뛰어난 성능을 보이며, 인간 레이블링 데이터에 대한 확장 가능한 대안을 제공한다.

ABSTRACT

Virtual counselors powered by large language models (LLMs) aim to create interactive support systems that effectively assist clients struggling with mental health challenges. To replicate counselor-client conversations, researchers have built an online mental health platform that allows professional counselors to provide clients with text-based counseling services for about an hour per session. Notwithstanding its effectiveness, challenges exist as human annotation is time-consuming, cost-intensive, privacy-protected, and not scalable. To address this issue and investigate the applicability of LLMs in psychological counseling conversation simulation, we propose a framework that employs two LLMs via role-playing for simulating counselor-client interactions. Our framework involves two LLMs, one acting as a client equipped with a specific and real-life user profile and the other playing the role of an experienced counselor, generating professional responses using integrative therapy techniques. We implement both the counselor and the client by zero-shot prompting the GPT-4 model. In order to assess the effectiveness of LLMs in simulating counselor-client interactions and understand the disparities between LLM- and human-generated conversations, we evaluate the synthetic data from various perspectives. We begin by assessing the client's performance through automatic evaluations. Next, we analyze and compare the disparities between dialogues generated by the LLM and those generated by professional counselors. Furthermore, we conduct extensive experiments to thoroughly examine the performance of our LLM-based counselor trained with synthetic interactive dialogues by benchmarking against state-of-the-art models for mental health.

연구 동기 및 목표

  • 인간 레이블링이 필요한 정신건강 상담 데이터의 확장성, 비용, 개인정보 보호 한계를 해결하기 위해.
  • 실제 인간 참가자를 활용하지 않고도 현실적이고 상호작용적인 상담사-고객 대화를 시뮬레이션하기 위해.
  • 인간이 생성한 세션과 비교하여 LLM이 생성한 대화의 품질과 치료적 충실도를 평가하기 위해.
  • 합성 데이터로 훈련된 LLM 기반 상담사의 성능을 최신 정신건강 대화 모델과 비교 평가하기 위해.
  • LLM을 활용한 심리 상담 시뮬레이션에서 발생할 수 있는 윤리적 및 실용적 과제를 탐색하기 위해.

제안 방법

  • 두 개의 GPT-4 모델을 사용하여 제로샷 역할 수행 설정을 구현한다: 하나는 사전 정의된 실제 생활 프로필을 가진 고객으로 설정되고, 다른 하나는 통합 치료 기법에 숙련된 상담사로 설정된다.
  • 고객 모델은 현실감을 높이기 위해 개인적이고 맥락적인 세부 정보를 포함한 특정 정신건강 문제를 시뮬레이션하도록 프롬프트된다.
  • 상담사 모델은 탐색, 통찰력, 행동 계획 수립에 중점을 두고 통합 치료 접근법을 사용하여 응답을 생성한다.
  • 반복적이고 상호작용적인 상호작용을 통해 실제 세션을 모방하는 합성 대화가 생성된다.
  • 다양한 지표를 사용하여 대화 품질 평가 및 인간이 생성한 세션과의 비교 평가를 자동으로 수행할 수 있다.
  • 향후 현실감 향상과 유사성 강화를 위해 검색 기반 생성(RAG)과 프롬프트 최적화 기법을 제안한다.

실험 결과

연구 질문

  • RQ1RQ1: LLM은 어떻게 효과적이고 자동적으로 역할 수행을 통해 상담사-고객 상호작용을 시뮬레이션할 수 있는가?
  • RQ2RQ2: 전문 인간 상담사가 생성한 세션과 비교해 LLM이 생성한 대화는 품질과 치료적 충실도 측면에서 어떻게 비교되는가?
  • RQ3RQ3: 합성 데이터로 미세조정된 LLM 기반 상담사의 성능은 최신 정신건강 대화 모델과 비교해 어떻게 되는가?
  • RQ4RQ4: LLM을 활용해 고객과 상담사를 모두 시뮬레이션할 경우 발생할 수 있는 윤리적 리스크와 한계는 무엇인가?
  • RQ5RQ5: 고객의 저항과 세션 진행 상황은 LLM이 생성한 대화의 품질과 깊이에 어떤 영향을 미치는가?

주요 결과

  • 자동 평가 지표를 통해 측정한 결과, LLM 기반 상담사는 전문 인간 상담사가 생성한 대화와 유사한 구조와 치료 품질을 보였다.
  • 합성 대화는 높은 일관성, 정서적 몰입도, 적절한 통합 치료 기법의 사용를 보이며 높은 현실감을 나타냈다.
  • 합성 데이터로 미세조정된 LLM 기반 상담사는 정신건강 대화 벤치마크에서 최신 기술 모델들과 경쟁 가능한 성능을 달성했다.
  • 역할 수행 프레임워크는 정의된 고객 프로필을 기반으로 전체 상담 세션을 성공적으로 시뮬레이션하여 확장성과 개인정보 보호의 가능성을 입증했다.
  • 불합리한 조언, 단순화된 고객 모델링, 제한된 상담 깊이 등이 LLM 시뮬레이션의 주요 한계로 확인되었으며, 윤리적 우려도 제기되었다.
  • 이 연구는 LLM이 고도로 품질이 높고 개인정보를 포함하지 않은 상담 대화를 생성할 수 있음을 확인하였으며, 인간 레이블링 데이터 수집의 실질적인 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.