[论文解读] MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL
MAC-SQL 提出了一种用于文本到SQL的多智能体协作框架,该框架使用分解器智能体进行思维链推理,选择器智能体进行子数据库提取,以及精炼器智能体通过外部工具进行SQL验证与修正。该方法在使用GPT-4的情况下,于BIRD基准测试中实现了59.59%的新SOTA执行准确率,展现出在复杂、真实世界数据库中的强大性能。
Recent LLM-based Text-to-SQL methods usually suffer from significant performance degradation on "huge" databases and complex user questions that require multi-step reasoning. Moreover, most existing methods neglect the crucial significance of LLMs utilizing external tools and model collaboration. To address these challenges, we introduce MAC-SQL, a novel LLM-based multi-agent collaborative framework. Our framework comprises a core decomposer agent for Text-to-SQL generation with few-shot chain-of-thought reasoning, accompanied by two auxiliary agents that utilize external tools or models to acquire smaller sub-databases and refine erroneous SQL queries. The decomposer agent collaborates with auxiliary agents, which are activated as needed and can be expanded to accommodate new features or tools for effective Text-to-SQL parsing. In our framework, We initially leverage GPT-4 as the strong backbone LLM for all agent tasks to determine the upper bound of our framework. We then fine-tune an open-sourced instruction-followed model, SQL-Llama, by leveraging Code Llama 7B, to accomplish all tasks as GPT-4 does. Experiments show that SQL-Llama achieves a comparable execution accuracy of 43.94, compared to the baseline accuracy of 46.35 for vanilla GPT-4. At the time of writing, MAC-SQL+GPT-4 achieves an execution accuracy of 59.59 when evaluated on the BIRD benchmark, establishing a new state-of-the-art (SOTA) on its holdout test set (https://github.com/wbbeyourself/MAC-SQL).
研究动机与目标
- 为解决基于大模型的文本到SQL方法在大型数据库和复杂多步问题上的性能下降问题。
- 克服现有方法在利用外部工具和协作推理方面的局限性。
- 设计一种模块化、可扩展的框架,使专业化智能体负责SQL生成中的不同子任务。
- 微调一个开源的7B模型(SQL-Llama),使其在协作智能体设置下达到与GPT-4相当的性能。
- 通过多智能体协作在BIRD基准测试中建立新的SOTA结果。
提出的方法
- 该框架采用三个专业智能体:分解器用于问题分解与思维链SQL生成,选择器用于提取相关子数据库以减少噪声,精炼器用于通过外部工具执行并修正SQL。
- 分解器使用 few-shot 思维链提示法,在生成SQL前进行逐步推理。
- 选择器通过基于问题的动态简化,从大型数据库中隔离出相关表与列。
- 精炼器使用外部SQL执行器验证生成的查询,并通过反馈迭代修正错误。
- 系统支持插件式扩展,允许集成新工具或智能体以适应不断变化的需求。
- 使用从BIRD和Spider衍生的指令微调数据集,对开源的SQL-Llama(7B)模型进行微调,以复现GPT-4的智能体行为。
实验结果
研究问题
- RQ1多智能体协作框架是否能提升在高模式复杂度的复杂真实世界数据库上的文本到SQL性能?
- RQ2结合思维链推理与外部工具使用,在减少SQL生成错误方面有多有效?
- RQ3微调后的7B开源大模型在多智能体文本到SQL流程中,能在多大程度上达到GPT-4的性能?
- RQ4子数据库选择是否能显著减少大型数据库中无关模式元素的干扰?
- RQ5模块化智能体架构是否能泛化于多种错误类型,并支持新工具的可扩展性?
主要发现
- MAC-SQL+GPT-4在BIRD基准测试的保留测试集上实现了59.59%的新SOTA执行准确率。
- 微调后的SQL-Llama(7B)模型实现了43.94%的执行准确率,接近GPT-4的基线水平(46.35%)。
- 与先前方法相比,该框架显著减少了模式关联错误,并提升了在复杂多步问题上的鲁棒性。
- 通过精炼器智能体使用外部工具,实现了有效的反馈驱动SQL修正,降低了执行错误。
- 模块化智能体设计支持动态激活与可扩展性,可支持新工具与推理模块的集成。
- 发布的智能体指令数据集与SQL-Llama模型为协作式文本到SQL的可复现、开源研究奠定了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。