Skip to main content
QUICK REVIEW

[论文解读] XRICL: Cross-lingual Retrieval-Augmented In-Context Learning for Cross-lingual Text-to-SQL Semantic Parsing

Peng Shi, Rui Zhang|arXiv (Cornell University)|Oct 25, 2022
Topic Modeling被引用 4
一句话总结

本文提出 XRICL,一种用于零样本跨语言文本到SQL语义解析的跨语言检索增强 few-shot in-context learning 框架。它检索相关的英文范例,并使用翻译指令提示,引导大型语言模型(如 Codex)将非英文查询翻译为 SQL,从而在多语言基准测试(包括 XSpider 和 XKaggle-dbqa)上实现最先进性能。

ABSTRACT

In-context learning using large language models has recently shown surprising results for semantic parsing tasks such as Text-to-SQL translation. Prompting GPT-3 or Codex using several examples of question-SQL pairs can produce excellent results, comparable to state-of-the-art finetuning-based models. However, existing work primarily focuses on English datasets, and it is unknown whether large language models can serve as competitive semantic parsers for other languages. To bridge this gap, our work focuses on cross-lingual Text-to-SQL semantic parsing for translating non-English utterances into SQL queries based on an English schema. We consider a zero-shot transfer learning setting with the assumption that we do not have any labeled examples in the target language (but have annotated examples in English). This work introduces the XRICL framework, which learns to retrieve relevant English exemplars for a given query to construct prompts. We also include global translation exemplars for a target language to facilitate the translation process for large language models. To systematically evaluate our model, we construct two new benchmark datasets, XSpider and XKaggle-dbqa, which include questions in Chinese, Vietnamese, Farsi, and Hindi. Our experiments show that XRICL effectively leverages large pre-trained language models to outperform existing baselines. Data and code are publicly available at https://github.com/Impavidity/XRICL.

研究动机与目标

  • 解决利用大型语言模型进行 in-context learning 时,针对非英文语言缺乏有效的跨语言文本到SQL语义解析方法的问题。
  • 克服在目标语言中无任何标注样本时的零样本迁移挑战。
  • 通过检索并重新排序非英文查询的相关英文范例,提升 few-shot in-context learning 的性能。
  • 通过引入一个全局翻译范例,指导模型在生成SQL之前先将查询翻译为英文,从而促进跨语言泛化。
  • 在新构建的多语言基准上系统评估该框架,以评估其零样本跨语言迁移能力。

提出的方法

  • 使用 mT5 训练英文范例检索器,基于跨语言语义相似性检索相关的英文问题-SQL 对。
  • 利用大型语言模型(Codex)生成的软标签进行知识蒸馏,以在无需人工标注反馈的情况下优化检索器性能。
  • 应用重排序模块,根据大型语言模型生成分布下的可能性对检索到的范例进行重排序。
  • 构建一个提示,其中包含一个翻译范例,指示模型在生成SQL之前先将非英文查询翻译为英文。
  • 通过翻译范例使用思维链提示(chain-of-thought prompting),在推理过程中提升推理能力与跨语言对齐效果。
  • 将检索到的范例与翻译提示整合到 Codex 的 in-context learning 设置中,以生成 SQL 查询。

实验结果

研究问题

  • RQ1在目标语言中无任何标注样本的情况下,使用 Codex 等大型语言模型进行 in-context learning 是否能有效实现零样本跨语言文本到SQL解析?
  • RQ2检索增强的范例选择在提升跨语言语义解析的 few-shot in-context learning 性能方面有多有效?
  • RQ3将翻译范例作为思维链提示是否能提升文本到SQL生成中的跨语言泛化能力?
  • RQ4在多种低资源语言中,所提出的框架在精确匹配准确率方面与强基线相比表现如何?
  • RQ5每个语言对的单一翻译范例在多大程度上能泛化到多样化的非英文查询?

主要发现

  • XRICL 超越了强基线模型,包括 Template Oracle,在 XSpider 完整数据集上达到 52.5 的 EM 准确率,在子集上达到 58.0。
  • 检索与重排序组件显著提升了范例质量,相较于随机检索或未经优化的检索方式,性能提升显著。
  • 添加作为思维链提示的全局翻译范例进一步提升了性能,证明其在弥合跨语言鸿沟方面的有效性。
  • 该框架在 XSpider 和 XKaggle-dbqa 两个基准上均实现了最先进结果,涵盖中文、越南语、波斯语和印地语四种语言。
  • 基于 LLM 生成的软标签进行知识蒸馏训练的检索器,在无需目标语言标注的情况下,实现了强大的零样本跨语言检索性能。
  • 模型在多样化语言中表现出强大的泛化能力,表明该框架即使在极少语言特异性数据的情况下也具有有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。