[论文解读] DTS-SQL: Decomposed Text-to-SQL with Small Large Language Models
本文提出 DTS-SQL,一种两阶段微调方法,将文本到 SQL 的任务分解为模式链接和 SQL 生成两个阶段,使用小型 7B 参数大语言模型。通过分离这两个任务,该方法在单阶段微调的基础上将执行准确率提高了 3–7 个百分点,使开源模型在基准数据集上的性能达到与 GPT-4 等专有模型相当的水平。
Leading models for the text-to-SQL task heavily rely on proprietary Large Language Models (LLMs), posing concerns over data privacy. Closing the performance gap between small open-source models and large proprietary models is crucial to mitigate this reliance. To this end, we introduce a novel two-stage fine-tuning approach that decomposes the task into two simpler tasks. Through comprehensive evaluation on two large cross-domain datasets and two small LLMs, we show that this approach improves execution accuracy by 3 to 7 percent, effectively aligning the performance of open-source models with their proprietary counterparts.
研究动机与目标
- 弥合小型开源大语言模型与 GPT-4 等大型专有模型在文本到 SQL 任务中的性能差距。
- 解决在企业环境中使用专有大语言模型所涉及的隐私和成本问题。
- 通过一种新颖的两阶段微调方法,提升小型 7B 参数大语言模型在跨领域文本到 SQL 基准测试中的性能。
- 证明分解式训练可以提升低资源环境下模式链接和 SQL 生成的准确率。
- 提供一种可复现的开源解决方案,在 Spider 和 Spider-SYN 数据集上超越现有微调过的开源模型。
提出的方法
- 该方法采用两阶段微调流程:首先训练一个专用模型,从问题和数据库模式中预测相关数据库表;其次,使用另一个独立模型,基于问题和预测出的模式生成 SQL。
- 模式链接通过一个微调过的大型语言模型实现,该模型以自然语言问题和数据库模式作为输入,输出一组相关表名。
- SQL 生成通过第二个微调过的大型语言模型完成,该模型以问题和模式链接器的输出作为输入,生成最终的 SQL 查询。
- 该方法在问题-SQL 对上采用监督微调(SFT),其中模式链接器在表选择任务上进行训练,SQL 生成器在完整查询生成任务上进行训练。
- 该流程将模式链接和查询生成的推理过程解耦,减轻了每个模型的认知负担,从而提升了整体准确率。
- 该方法在两个大型跨领域基准测试(Spider 和 Spider-SYN)上进行评估,使用了两种 7B 参数的大语言模型:Mistral 和 DeepSeek。

实验结果
研究问题
- RQ1将文本到 SQL 任务分解为模式链接和 SQL 生成两个阶段,能否提升小型开源大语言模型的性能?
- RQ2在采用此分解方法时,小型 7B 参数大语言模型在多大程度上能够实现与 GPT-4 相当的性能?
- RQ3模式链接组件的性能在多大程度上影响整个文本到 SQL 流程的执行准确率?
- RQ4与端到端微调相比,分离任务是否能带来更好的泛化能力并减少错误传播?
- RQ5该方法是否能在 Spider 和 Spider-SYN 等标准基准测试上超越现有微调过的开源模型?
主要发现
- 在 Spider 和 Spider-SYN 数据集上,与单阶段微调相比,DTS-SQL 方法将执行准确率提高了 3 至 7 个百分点。
- 在 Spider 开发集上,该方法使用 DeepSeek 7B 达到了 85.5% 的执行准确率,使用 Mistral 7B 达到了 78.6%,均超过所有先前的开源微调模型。
- 模式链接模型在 Spider 上实现了 93.1% 的精确集合匹配准确率,在 Spider-SYN 上达到了 87.6%,表明其表选择性能出色。
- 尽管仅使用小型开源大语言模型,该方法的性能与基于 GPT-4 的提示工程技术(如 DIN-SQL + GPT4(74.2% EX)和 DAIL-SQL + GPT4(84.4% EX))相当。
- SQL 生成器的上限性能(使用 Mistral 7B 时达到 86.6% EX)表明,若模式链接性能进一步提升,仍有改进空间。
- 结果表明,任务分解显著提升了小型大语言模型在复杂文本到 SQL 生成任务中的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。