[论文解读] DiagGPT: An LLM-based and Multi-agent Dialogue System with Automatic Topic Management for Flexible Task-Oriented Dialogue
DiagGPT 是一种基于多智能体 LLM 的系统,通过自动话题管理实现灵活的任务导向对话,使人工智能能够主动引导用户完成结构化咨询——在医疗和法律诊断场景中,其表现优于标准 LLM。
A significant application of Large Language Models (LLMs), like ChatGPT, is their deployment as chat agents, which respond to human inquiries across a variety of domains. While current LLMs proficiently answer general questions, they often fall short in complex diagnostic scenarios such as legal, medical, or other specialized consultations. These scenarios typically require Task-Oriented Dialogue (TOD), where an AI chat agent must proactively pose questions and guide users toward specific goals or task completion. Previous fine-tuning models have underperformed in TOD and the full potential of conversational capability in current LLMs has not yet been fully explored. In this paper, we introduce DiagGPT (Dialogue in Diagnosis GPT), an innovative approach that extends LLMs to more TOD scenarios. In addition to guiding users to complete tasks, DiagGPT can effectively manage the status of all topics throughout the dialogue development. This feature enhances user experience and offers a more flexible interaction in TOD. Our experiments demonstrate that DiagGPT exhibits outstanding performance in conducting TOD with users, showing its potential for practical applications in various fields.
研究动机与目标
- 解决标准 LLM 在复杂、目标驱动的对话场景(如医疗或法律咨询)中的局限性。
- 开发一种能够主动管理对话话题并引导用户完成任务的系统,而非被动回答问题。
- 克服微调小模型在任务导向对话中的不足,包括状态跟踪能力差和推理能力有限的问题。
- 设计一种可扩展、可扩展的框架,利用 LLM 的推理和理解能力,应用于现实世界的专业咨询场景。
提出的方法
- DiagGPT 采用多智能体架构,配备基于 LLM 的专用智能体,分别负责对话管理、话题跟踪和响应生成。
- 系统使用预定义的话题清单(例如,基本信息、主诉、症状持续时间)以结构化方式引导对话流程。
- 话题管理智能体根据用户输入动态选择并推进话题,实现自动话题推进和话题转换的处理。
- 系统结合思维链提示和上下文学习,以增强复杂诊断场景下的推理能力和响应质量。
- 内部智能体之间的协调支持主动提问和自适应对话流程,模拟真实咨询中专家的行为。
- 该框架支持可扩展性,允许集成新工具、新领域或新推理模块,以拓展应用范围。

实验结果
研究问题
- RQ1基于 LLM 的多智能体系统是否能在不依赖微调小模型的情况下,有效管理任务导向对话中的话题推进?
- RQ2该系统在多大程度上能通过主动引导用户进行结构化信息收集,模拟医疗或法律咨询中专家的行为?
- RQ3与标准 LLM 相比,自动话题管理在多大程度上提升了对话连贯性和任务完成度?
- RQ4在将多智能体 LLM 系统部署于现实对话应用时,主要挑战是什么,特别是成本、稳定性及提示敏感性方面?
主要发现
- DiagGPT 在医疗咨询场景中成功展示了任务导向对话,能够引导用户按预设话题(如症状持续时间、严重程度)进行交流。
- 系统表现出主动性,基于清单生成后续问题,实现系统性信息收集,无需用户主动提示。
- 案例研究显示,DiagGPT 能够动态切换话题——例如,当用户提及相关查询时,主动引入‘新冠’等新话题,展现出灵活、类人对话的适应能力。
- 与 ChatGPT 等标准 LLM 不同,DiagGPT 能够保持对话焦点和状态跟踪,在复杂、多轮交互中仍能实现目标导向的结果。
- 系统性能受限于高计算成本和延迟,主要源于多次 LLM 调用和内部智能体协调,凸显了可扩展性挑战。
- 当话题管理智能体对对话方向判断失误时,尤其在用户输入模糊的情况下,会出现稳定性问题,表明需要优化提示工程和后处理机制。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。