[논문 리뷰] ChatCounselor: A Large Language Models for Mental Health Support
ChatCounselor는 전문 상담 데이터(Psych8k)로 미세조정된 LLM으로 정서 건강 지원을 제공하며 오픈 소스 모델을 능가하고 ChatGPT 성능에 근접한다.
This paper presents ChatCounselor, a large language model (LLM) solution designed to provide mental health support. Unlike generic chatbots, ChatCounselor is distinguished by its foundation in real conversations between consulting clients and professional psychologists, enabling it to possess specialized knowledge and counseling skills in the field of psychology. The training dataset, Psych8k, was constructed from 260 in-depth interviews, each spanning an hour. To assess the quality of counseling responses, the counseling Bench was devised. Leveraging GPT-4 and meticulously crafted prompts based on seven metrics of psychological counseling assessment, the model underwent evaluation using a set of real-world counseling questions. Impressively, ChatCounselor surpasses existing open-source models in the counseling Bench and approaches the performance level of ChatGPT, showcasing the remarkable enhancement in model capability attained through high-quality domain-specific data.
연구 동기 및 목표
- 라이선스가 있는 상담사로부터 고품질 상담 데이터셋(Psych8k)을 구축한다.
- 심리 상담을 위한 도메인 특화 지시-튜닝 파이프라인을 개발한다.
- 전용 Counseling Bench와 GPT-4 자동 평가를 사용하여 상담 품질을 평가한다.
- 도메인 중심 데이터가 오픈 소스 베이스라인 대비 성능을 향상시킴을 입증한다.
- 연구를 재현하고 확장할 수 있도록 코드를 공개한다.
제안 방법
- 현장 260건의 상담 인터뷰에서 Psych8k를 수집하고, GPT-4를 사용해 약 2M 토큰에 이르는 8,187개의 지시 쌍으로 증류한다.
- 상담 작업을 위한 도메인 특화 지시로 LLaMA-7B 기본 모델을 미세조정한다.
- 상담 기술에 맞추기 위해 자가회귀 학습으로 지시-튜닝을 활용한다.
- 일곱 전략 기반 Counseling Bench와 실제 질문 229개를 사용해 평가한다.
- 전략별로 모델 출력을 점수 매기기 위해 자동 심판으로 GPT-4를 활용한다.
- 맥락 길이, 배치 크기, 최적화 알고리즘, 하드웨어를 포함한 학습 설정 세부 정보를 보고한다.
실험 결과
연구 질문
- RQ1도메인 특화 상담 데이터가 정신 건강 지원에서 LLM 성능을 향상시킬 수 있는가?
- RQ2도메인 관련 상담 전략에서 ChatCounselor의 성능이 오픈 소스 베이스라인과 비교하여 어떤가?
- RQ3적은 양의 고품질 전문 데이터가 상담 품질에 측정 가능한 향상을 가져오는가?
- RQ4자동화된 GPT-4 평가가 상담 능력에 대해 강건하고 신속한 평가를 제공할 수 있는가?
주요 결과
- ChatCounselor는 Counseling Bench에서 오픈 소스 LLaMA-7B, Alpaca-7B, ChatGLM-v2-7B, Robins-v2-7B를 능가한다.
- 자동 평가에서 ChatGPT의 성능에 근접하다.
- 상담 특화 데이터로의 미세조정이 기본 모델 및 일반 지시-튜닝 변형을 넘어선 개선을 보인다.
- 비교적 작고 고품질의 데이터셋(Psych8k)이 도메인 특화 상담 성능을 크게 향상시킬 수 있다.
- GPT-4 기반 자동 평가가 수동 평가를 보완하고 빠른 벤치마킹을 지원한다.
- 이 접근법은 전문 대화 시스템에 대한 실세계 전문가 데이터의 가치를 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.