[论文解读] CORE-T: COherent REtrieval of Tables for Text-to-SQL
CORE-T 是一个零训练框架,通过离线增强与单次基于大模型的选择以及基于兼容性的一步恢复,在汇集的开卷语料库中检索可拼接的、连贯的表子集,用于文本到 SQL。
Realistic text-to-SQL workflows often require joining multiple tables. As a result, accurately retrieving the relevant set of tables becomes a key bottleneck for end-to-end performance. We study an open-book setting where queries must be answered over large, heterogeneous table collections pooled from many sources, without clean scoping signals such as database identifiers. Here, dense retrieval (DR) achieves high recall but returns many distractors, while join-aware alternatives often rely on extra assumptions and/or incur high inference overhead. We propose CORE-T, a scalable, training-free framework that enriches tables with LLM-generated purpose metadata and pre-computes a lightweight table-compatibility cache. At inference time, DR returns top-K candidates; a single LLM call selects a coherent, joinable subset, and a simple additive adjustment step restores strongly compatible tables. Across Bird, Spider, and MMQA, CORE-T improves table-selection F1 by up to 22.7 points while retrieving up to 42% fewer tables, improving multi-table execution accuracy by up to 5.0 points on Bird and 6.9 points on MMQA, and using 4-5x fewer tokens than LLM-intensive baselines.
研究动机与目标
- 解决在大型异质表集合中对相关且可拼接的表进行检索的瓶颈,且没有 db_id 信号的开卷文本到 SQL 场景。
- 离线对表进行目的描述等元数据的增强,并构建一个轻量级的表–表兼容性缓存以近似可拼接性。
- 提供一个可扩展的在线流水线:使用密集检索实现高召回率、一次性的大模型通过以获得一致的子集、以及一个恢复步骤以从而强力兼容的表中恢复。
提出的方法
- 离线,通过大模型生成的用途描述和5行 Markdown 快照对表进行增强,以创建用于密集检索的表嵌入(嵌入 f_tbl)。
- 按列层面的信号(表头嵌入、数值重叠和关系约束)用于构建表–表兼容性缓存 CS(t_i, t_j),以近似可拼接性。
- 在线,通过对增强嵌入进行密集检索来获取前-K 个表(RS(q,t) = cosine(e_q, e_t))。
- 一次性的大模型充当架构分析师,利用提供的兼容证据和采样表元数据,从前-K 候选中选择一个连贯、可拼接的子集。
- 一个附加的调整步骤从原始前-K 中恢复强烈兼容的表,得到最终集合 S(q)。
- 所有步骤都设计为零训练,并在最大化拼接连贯性的同时尽量减少大模型的使用量。
实验结果
研究问题
- RQ1如何在没有显式 db_id 或黄金外键的情况下使开卷多表检索具备拼接意识?
- RQ2离线增强加上轻量级在线大模型选择是否能提升表的一致性与端到端 SQL 执行在汇集语料上的表现?
- RQ3基于兼容性的恢复步骤对召回率和下游 SQL 精度有何影响?
- RQ4相较于需要 db_id 或 MIP 优化的拼接感知方法,CORE-T 的效率在开卷设置中是否具有竞争力或优越性?
主要发现
- CORE-T 在 Bird、Spider、MMQA 等数据集上检索的表选择精度和 F1 值优于强基线,且检索表数更少。
- 一次性大模型选择加上轻量级恢复步骤比仅使用密集检索获得更一致的模式切片和更好的多表执行(EM ≥2T)。
- CORE-T 在不同 SQL 生成器下对多表问题的端到端 SQL 执行准确性更高,相对于 oracle 金表设置的头部裕度有所下降。
- 在选择阶段大模型的使用量降低约4–5倍,相比更重的多草案基线,令牌消耗最高可节省约5倍。
- 与需要 db_id 或 MIP 优化的拼接感知方法相比,CORE-T 提供具有竞争力或更优的表集合质量,同时推理开销显著更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。