Skip to main content
QUICK REVIEW

[논문 리뷰] CORE-T: COherent REtrieval of Tables for Text-to-SQL

Hassan Soliman, Vivek Gupta|TUbilio (Technical University of Darmstadt)|2026. 01. 19.
Data Quality and Management인용 수 0
한 줄 요약

CORE-T은 training-free 프레임워크로 offline enrichment과 단일-shot LLM 기반 선택 및 호환성 기반 복원 단계를 통해 텍스트-대-SQL을 위한 풀링된 오픈 북 코퍼스에서 일관되고 조인 가능한 표의 합치 가능한 부분 집합을 검색합니다.

ABSTRACT

Realistic text-to-SQL workflows often require joining multiple tables. As a result, accurately retrieving the relevant set of tables becomes a key bottleneck for end-to-end performance. We study an open-book setting where queries must be answered over large, heterogeneous table collections pooled from many sources, without clean scoping signals such as database identifiers. Here, dense retrieval (DR) achieves high recall but returns many distractors, while join-aware alternatives often rely on extra assumptions and/or incur high inference overhead. We propose CORE-T, a scalable, training-free framework that enriches tables with LLM-generated purpose metadata and pre-computes a lightweight table-compatibility cache. At inference time, DR returns top-K candidates; a single LLM call selects a coherent, joinable subset, and a simple additive adjustment step restores strongly compatible tables. Across Bird, Spider, and MMQA, CORE-T improves table-selection F1 by up to 22.7 points while retrieving up to 42% fewer tables, improving multi-table execution accuracy by up to 5.0 points on Bird and 6.9 points on MMQA, and using 4-5x fewer tokens than LLM-intensive baselines.

연구 동기 및 목표

  • 대형 이질적 표 모음에서 db_id 신호 없이 관련 있고 조인 가능한 표를 검색하는 병목 현상을 해결합니다.
  • 목표 메타데이터로 표를 오프라인으로 풍부화하고 조인 가능성을 근사하는 경량의 표–표 호환성 캐시를 구축합니다.
  • 높은 재현을 위한 밀집 검색을 사용하고, 일관된 하위 집합 선택을 위한 단일 LLM 패스, 그리고 강하게 호환되는 표를 복원하는 복원 단계를 제공하는 확장 가능한 온라인 파이프라인을 제공합니다.

제안 방법

  • LLM으로 생성된 목적 설명과 5-row Markdown 스냅샷으로 오프라인에서 표를 풍부화하여 밀집 검색을 위한 표 임베딩(embedding f_tbl)을 생성합니다.
  • 헤더 임베딩, 값 중복, 관계 제약 등의 열 수준 신호를 사용하여 표-표 호환성 캐시 CS(t_i, t_j)를 구축하고 조인 가능성을 근사합니다.
  • 온라인에서 enriched 임베딩에 대해 상위-K 표를 밀집 검색으로 검색합니다(RS(q,t) = cosine(e_q, e_t)).
  • 단일 LLM 패스가 스키마 분석가로 작동하여 주어진 호환성 증거와 샘플링된 표 메타데이터를 사용해 상위-K 후보 중 일관되고 조인 가능한 부분집합을 선택합니다.
  • 호환성 캐시를 사용하여 원래 상위-K에서 강하게 호환되는 표를 추가 보정 단계로 복원하고 최종 집합 S(q)를 도출합니다.
  • 모든 단계는 학습 없이 설계되었으며 조인 일관성을 극대화하면서 LLM 사용을 최소화하도록 구성됩니다.

실험 결과

연구 질문

  • RQ1오픈 북 다표 검색을 db_id나 골 값 외래 키 없이 조인 가능하게 만들 수 있는가?
  • RQ2오프라인 풍부화와 경량의 온라인 LLM 선택이 풀링된 코퍼스에서 표의 일관성과 엔드-투-엔드 SQL 실행을 개선하는가?
  • RQ3호환성 기반 복원 단계가 재현율과 다운스트림 SQL 정확도에 미치는 영향은 무엇인가?
  • RQ4 CORE-T의 효율성이 오픈 북 설정에서 반복적이거나 MIP 기반 조인 가능 베이스라인과 비교해 어떤가?

주요 결과

  • CORE-T는 Bird, Spider, MMQA 전반에서 강력한 베이스라인에 비해 더 적은 표를 검색하면서 표 선택 정확도와 F1를 향상시켰습니다.
  • 단일 LLM 선택 plus 경량 복원 단계가 밀집 검색만으로 얻는 것보다 더 일관된 스키마 부분집합과 다표 실행에서 더 나은 성능(EM ≥2T)을 제공합니다.
  • CORE-T는 다양한 SQL 생성기에서 다표 질문에 대해 엔드-투-엔드 SQL 실행 정확도를 높이고 오리진 골-테이블 설정 대비 여유를 줄입니다.
  • 선택에서 LLM 사용을 약 4–5배 감소시키고 더 무거운 다 초안 베이스라인 대비 최대 ~5배의 토큰 절감 효과를 보입니다.
  • db_id나 MIP 최적화를 필요로 하는 조인-가능 방법과 비교할 때, CORE-T는 비교적 낮은 추론 오버헤드로 경쟁력 있거나 우수한 표 집합 품질을 제공합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.