[논문 리뷰] DiagGPT: An LLM-based and Multi-agent Dialogue System with Automatic Topic Management for Flexible Task-Oriented Dialogue
DiagGPT는 자동 주제 관리 기반으로 다중 에이전트 LLM 기반 시스템으로, 구조화된 상담을 통해 사용자를 능동적으로 이끌 수 있도록 태스크 중심 대화를 유연하게 구현한다—표준 LLM보다 의료 및 법적 진단 시나리오에서 뛰어난 성능을 보여준다.
A significant application of Large Language Models (LLMs), like ChatGPT, is their deployment as chat agents, which respond to human inquiries across a variety of domains. While current LLMs proficiently answer general questions, they often fall short in complex diagnostic scenarios such as legal, medical, or other specialized consultations. These scenarios typically require Task-Oriented Dialogue (TOD), where an AI chat agent must proactively pose questions and guide users toward specific goals or task completion. Previous fine-tuning models have underperformed in TOD and the full potential of conversational capability in current LLMs has not yet been fully explored. In this paper, we introduce DiagGPT (Dialogue in Diagnosis GPT), an innovative approach that extends LLMs to more TOD scenarios. In addition to guiding users to complete tasks, DiagGPT can effectively manage the status of all topics throughout the dialogue development. This feature enhances user experience and offers a more flexible interaction in TOD. Our experiments demonstrate that DiagGPT exhibits outstanding performance in conducting TOD with users, showing its potential for practical applications in various fields.
연구 동기 및 목표
- 의료 또는 법적 상담과 같은 복잡한 목표 지향 대화 시나리오에서 표준 LLM의 한계를 해결하기 위해.
- 사용자에게 수동적으로 질문에 응답하는 것이 아니라, 대화 주제를 능동적으로 관리하고 작업 완료를 유도하는 시스템을 개발하기 위해.
- 작은 모델의 미세조정 방식에서 나타나는 상태 추적 능력 부족 및 제한된 추론 능력 등의 단점을 극복하기 위해.
- 실제 전문 상담 응용 분야에 적합한 LLM의 추론 및 이해 능력을 활용할 수 있는 확장 가능하고 유연한 프레임워크를 설계하기 위해.
제안 방법
- DiagGPT는 대화 관리, 주제 추적, 응답 생성을 전담한 LLM 기반의 전용 에이전트를 포함한 다중 에이전트 아키텍처를 사용한다.
- 시스템은 기본 정보, 주된 불편사항, 증상 지속 기간 등의 주제 체크리스트를 사전 정의하여 대화 흐름을 체계적으로 유도한다.
- 주제 관리자 에이전트는 사용자 입력에 기반해 주제를 동적으로 선택하고 진행함으로써 자동 주제 전환과 주제 이탈 처리를 가능하게 한다.
- 복잡한 진단 시나리오에서 추론 능력과 응답 품질을 향상시키기 위해 체인 오브 톰(Chain-of-Thought) 프롬프팅과 인라인 컨텍스트 학습을 통합한다.
- 에이전트 간의 내부 협업을 통해 능동적인 질문 제시와 적응형 대화 흐름을 가능하게 하여 실제 전문가의 행동 방식을 시뮬레이션한다.
- 확장성 지원을 통해 새로운 도구, 도메인 또는 추론 모듈의 통합이 가능하여 더 넓은 응용 분야에 대응할 수 있다.

실험 결과
연구 질문
- RQ1미세조정된 소형 모델에 의존하지 않고도 LLM 기반 다중 에이전트 시스템이 태스크 중심 대화에서 주제 전환을 효과적으로 관리할 수 있는가?
- RQ2의료 또는 법적 상담에서 사용자에게 체계적인 정보 수집을 위한 능동적 안내를 통해 전문가의 행동을 얼마나 잘 시뮬레이션할 수 있는가?
- RQ3자동 주제 관리 방식이 표준 LLM 대비 대화의 일관성과 작업 완료율을 얼마나 향상시키는가?
- RQ4비용, 안정성, 프롬프팅 민감도 측면에서 실생활 대화 응용 분야에 다중 에이전트 LLM 시스템을 구현할 때의 주요 과제는 무엇인가?
주요 결과
- DiagGPT는 의료 상담 시나리오에서 태스크 중심 대화를 성공적으로 구현하여 증상 지속 기간, 심각도 등의 사전 정의된 주제를 통해 사용자를 이끌었다.
- 체크리스트 기반으로 후속 질문을 생성함으로써 수동적인 질문에 응답하는 것이 아니라 능동적인 행동을 보이며, 사용자 자극 없이도 체계적인 정보 수집을 가능하게 했다.
- 사례 연구에서는 사용자가 관련 질의를 제기할 경우 자동으로 새로운 주제(예: 코로나19)를 도입함으로써 인간과 유사한 다이내믹한 대화 적응 능력을 입증했다.
- ChatGPT와 같은 표준 LLM과 달리 DiagGPT는 대화 집중력과 상태 추적 능력을 유지하여 복잡한 다단계 상호작용에서도 목표 지향적 결과를 달성했다.
- 시스템의 성능은 다중 LLM 호출 및 내부 에이전트 간 협업으로 인한 높은 계산 비용과 지연 시간으로 인해 제한되며, 확장성 문제를 드러냈다.
- 사용자 입력이 모호할 경우 주제 관리자에서 대화 방향을 잘못 판단해 안정성 문제가 발생함을 확인했으며, 이는 보다 정교한 프롬프팅 및 후처리 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.