Skip to main content
QUICK REVIEW

[论文解读] DTS-SQL: Decomposed Text-to-SQL with Small Large Language Models

Mohammadreza Pourreza, Davood Rafiei|arXiv (Cornell University)|Feb 2, 2024
Scientific Computing and Data Management被引用 4
一句话总结

本文提出 DTS-SQL,一种两阶段微调方法,将文本到 SQL 的任务分解为模式链接和 SQL 生成两个阶段,使用小型 7B 参数大语言模型。通过分离这两个任务,该方法在单阶段微调的基础上将执行准确率提高了 3–7 个百分点,使开源模型在基准数据集上的性能达到与 GPT-4 等专有模型相当的水平。

ABSTRACT

Leading models for the text-to-SQL task heavily rely on proprietary Large Language Models (LLMs), posing concerns over data privacy. Closing the performance gap between small open-source models and large proprietary models is crucial to mitigate this reliance. To this end, we introduce a novel two-stage fine-tuning approach that decomposes the task into two simpler tasks. Through comprehensive evaluation on two large cross-domain datasets and two small LLMs, we show that this approach improves execution accuracy by 3 to 7 percent, effectively aligning the performance of open-source models with their proprietary counterparts.

研究动机与目标

  • 弥合小型开源大语言模型与 GPT-4 等大型专有模型在文本到 SQL 任务中的性能差距。
  • 解决在企业环境中使用专有大语言模型所涉及的隐私和成本问题。
  • 通过一种新颖的两阶段微调方法,提升小型 7B 参数大语言模型在跨领域文本到 SQL 基准测试中的性能。
  • 证明分解式训练可以提升低资源环境下模式链接和 SQL 生成的准确率。
  • 提供一种可复现的开源解决方案,在 Spider 和 Spider-SYN 数据集上超越现有微调过的开源模型。

提出的方法

  • 该方法采用两阶段微调流程:首先训练一个专用模型,从问题和数据库模式中预测相关数据库表;其次,使用另一个独立模型,基于问题和预测出的模式生成 SQL。
  • 模式链接通过一个微调过的大型语言模型实现,该模型以自然语言问题和数据库模式作为输入,输出一组相关表名。
  • SQL 生成通过第二个微调过的大型语言模型完成,该模型以问题和模式链接器的输出作为输入,生成最终的 SQL 查询。
  • 该方法在问题-SQL 对上采用监督微调(SFT),其中模式链接器在表选择任务上进行训练,SQL 生成器在完整查询生成任务上进行训练。
  • 该流程将模式链接和查询生成的推理过程解耦,减轻了每个模型的认知负担,从而提升了整体准确率。
  • 该方法在两个大型跨领域基准测试(Spider 和 Spider-SYN)上进行评估,使用了两种 7B 参数的大语言模型:Mistral 和 DeepSeek。
Figure 1: The prompt used for SQL generation. The database schema is where we put the tables representations.
Figure 1: The prompt used for SQL generation. The database schema is where we put the tables representations.

实验结果

研究问题

  • RQ1将文本到 SQL 任务分解为模式链接和 SQL 生成两个阶段,能否提升小型开源大语言模型的性能?
  • RQ2在采用此分解方法时,小型 7B 参数大语言模型在多大程度上能够实现与 GPT-4 相当的性能?
  • RQ3模式链接组件的性能在多大程度上影响整个文本到 SQL 流程的执行准确率?
  • RQ4与端到端微调相比,分离任务是否能带来更好的泛化能力并减少错误传播?
  • RQ5该方法是否能在 Spider 和 Spider-SYN 等标准基准测试上超越现有微调过的开源模型?

主要发现

  • 在 Spider 和 Spider-SYN 数据集上,与单阶段微调相比,DTS-SQL 方法将执行准确率提高了 3 至 7 个百分点。
  • 在 Spider 开发集上,该方法使用 DeepSeek 7B 达到了 85.5% 的执行准确率,使用 Mistral 7B 达到了 78.6%,均超过所有先前的开源微调模型。
  • 模式链接模型在 Spider 上实现了 93.1% 的精确集合匹配准确率,在 Spider-SYN 上达到了 87.6%,表明其表选择性能出色。
  • 尽管仅使用小型开源大语言模型,该方法的性能与基于 GPT-4 的提示工程技术(如 DIN-SQL + GPT4(74.2% EX)和 DAIL-SQL + GPT4(84.4% EX))相当。
  • SQL 生成器的上限性能(使用 Mistral 7B 时达到 86.6% EX)表明,若模式链接性能进一步提升,仍有改进空间。
  • 结果表明,任务分解显著提升了小型大语言模型在复杂文本到 SQL 生成任务中的有效性。
Figure 2: The prompt used for Schema linking. The database schema is where we put the tables representations.
Figure 2: The prompt used for Schema linking. The database schema is where we put the tables representations.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。