Skip to main content
QUICK REVIEW

[论文解读] CHASE-SQL: Multi-Path Reasoning and Preference Optimized Candidate Selection in Text-to-SQL

Mohammadreza Pourreza, Hailong Li|arXiv (Cornell University)|Oct 2, 2024
Advanced Database Systems and Queries被引用 4
一句话总结

CHASE-SQL 提出了一种测试时计算框架,通过多路径推理和偏好优化的候选选择机制,提升了文本到SQL的性能。通过结合分解-合并策略、基于执行计划的思维链(CoT)以及实例感知的合成示例生成,该方法生成多样化且高质量的SQL候选,再通过微调的二分类选择大模型进行排序,最终在BIRD开发集上实现了73.01%的最先进执行准确率。

ABSTRACT

In tackling the challenges of large language model (LLM) performance for Text-to-SQL tasks, we introduce CHASE-SQL, a new framework that employs innovative strategies, using test-time compute in multi-agent modeling to improve candidate generation and selection. CHASE-SQL leverages LLMs' intrinsic knowledge to generate diverse and high-quality SQL candidates using different LLM generators with: (1) a divide-and-conquer method that decomposes complex queries into manageable sub-queries in a single LLM call; (2) chain-of-thought reasoning based on query execution plans, reflecting the steps a database engine takes during execution; and (3) a unique instance-aware synthetic example generation technique, which offers specific few-shot demonstrations tailored to test questions.To identify the best candidate, a selection agent is employed to rank the candidates through pairwise comparisons with a fine-tuned binary-candidates selection LLM. This selection approach has been demonstrated to be more robust over alternatives. The proposed generators-selector framework not only enhances the quality and diversity of SQL queries but also outperforms previous methods. Overall, our proposed CHASE-SQL achieves the state-of-the-art execution accuracy of 73.0% and 73.01% on the test set and development set of the notable BIRD Text-to-SQL dataset benchmark, rendering CHASE-SQL the top submission of the leaderboard (at the time of paper submission).

研究动机与目标

  • 解决现有文本到SQL方法依赖单提示生成和自一致性机制的局限性,这些方法未能充分挖掘大语言模型内在知识的潜力。
  • 在不牺牲准确率的前提下,提升SQL生成过程中的候选多样性与质量,尤其在高温采样或复杂查询条件下表现更优。
  • 开发一种鲁棒且可学习的选择机制,通过成对比较方法,超越自一致性和基于排序的方法。
  • 通过多智能体编排优化测试时计算,整合推理策略、合成数据与值检索技术,以增强对数据库模式的理解。
  • 通过结合多样化生成技术与训练好的选择代理,在BIRD基准上实现最先进的执行准确率。

提出的方法

  • 采用分解-合并策略,通过一次大模型调用将复杂自然语言问题分解为子查询,以提升在复杂模式上的推理能力。
  • 实施基于查询执行计划的思维链(CoT)提示方法,使推理步骤与数据库引擎在查询执行过程中实际采取的步骤保持一致。
  • 引入实例感知的合成示例生成方法,为每个测试问题生成针对特定模式和值的少样本示范。
  • 使用通过二分类训练的候选选择代理,通过成对比较对候选进行打分,并将结果聚合为累积排名以完成最终选择。
  • 集成局部敏感哈希(LSH)模块以实现高效的值检索,并引入查询修复模块以纠正生成SQL中的语法错误。
  • 结合三种不同的候选生成器(分解-合并CoT、执行计划CoT和合成示例CoT),以最大化候选池的多样性与质量。

实验结果

研究问题

  • RQ1多路径推理策略(如分解-合并和基于执行计划的思维链)是否能提升复杂文本到SQL任务中生成SQL查询的质量与多样性?
  • RQ2实例感知的合成示例生成在增强大模型对模式的理解以及提升对未见测试问题的少样本泛化能力方面有多有效?
  • RQ3基于成对比较的可学习选择代理是否能超越传统的自一致性与基于排序的方法,在多样化候选中更优地选出正确SQL查询?
  • RQ4当在生成与选择阶段战略性地应用测试时计算时,其对BIRD等挑战性基准的执行准确率提升程度如何?
  • RQ5在消融研究中,各组件(如LSH、查询修复模块和推理策略)对整体框架性能的影响如何?

主要发现

  • CHASE-SQL在BIRD开发集上实现了73.01%的新SOTA执行准确率,在测试集上达到73.0%,优于提交时的已有方法。
  • 所提出的候选选择代理即使在高温采样(T=1.8)条件下,相比自一致性方法仍能提升约6个百分点的性能,表明其对候选多样性具有强鲁棒性。
  • 消融研究显示,若移除任一核心组件(LSH、查询修复模块或推理策略),准确率均出现可测量下降,其中用排序代理替代选择代理时准确率下降最大(达7.5%)。
  • 随着采样温度升高(T=1.8),选择代理保持或提升性能,而自一致性方法性能则下降,表明该代理对噪声或多样化候选具有更强的适应能力。
  • 三种不同推理策略(分解-合并、执行计划CoT与合成示例)的组合在多样性与选择效果上均优于单一方法,展现出协同增益。
  • 性能上限(82.79%)远高于自一致性方法(68.84%),凸显了更优选择机制的巨大潜力——而这正是CHASE-SQL选择代理所解决的核心问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。