[论文解读] CLASP: Few-Shot Cross-Lingual Data Augmentation for Semantic Parsing
CLASP 提出了一种少样本跨语言数据增强方法,利用大型语言模型(AlexaTM 20B)为低资源设置生成合成的语义解析训练数据。通过提示 LLM 同时生成目标语言或相同语言的文本和解析(采用槽位替换、翻译或联合生成),CLASP 提升了零样本跨语言泛化能力,在 mTOP 上实现 6.1 的绝对性能提升,在英语 Pizza 数据集上提升 4.79 分,仅使用 16 个训练样本。
A bottleneck to developing Semantic Parsing (SP) models is the need for a large volume of human-labeled training data. Given the complexity and cost of human annotation for SP, labeled data is often scarce, particularly in multilingual settings. Large Language Models (LLMs) excel at SP given only a few examples, however LLMs are unsuitable for runtime systems which require low latency. In this work, we propose CLASP, a simple method to improve low-resource SP for moderate-sized models: we generate synthetic data from AlexaTM 20B to augment the training set for a model 40x smaller (500M parameters). We evaluate on two datasets in low-resource settings: English PIZZA, containing either 348 or 16 real examples, and mTOP cross-lingual zero-shot, where training data is available only in English, and the model must generalize to four new languages. On both datasets, we show significant improvements over strong baseline methods.
研究动机与目标
- 为解决语义解析中,特别是在多语言设置下人工标注训练数据稀缺的问题。
- 克服标准数据增强在语义解析中的局限性,即文本修改常导致解析一致性被破坏。
- 通过使用大型语言模型生成高质量合成训练样本,实现在少样本设置下的有效跨语言泛化。
- 在不依赖大规模预训练或运行时 LLM 的前提下,提升中等规模模型(如 500M 参数)在低资源设置下的性能。
- 开发一个稳健的端到端数据增强流水线,保持跨语言的文本-解析对齐,并处理槽位错位或大小写错误等失败模式。
提出的方法
- CLASP 使用四种提示策略:RS(替换槽位并在同语言生成文本)、TS(翻译槽位并在新语言生成文本)、GB(在同语言中联合生成解析和文本)、TB(在跨语言设置中翻译解析和文本)。
- 对于每种方法,LLM 会接收少量上下文示例(以 '语义解析:... 英文翻译:...' 的形式呈现),以确保输出格式一致并提升零样本泛化能力。
- 该方法包含一个 '修复大小写' 的恢复机制,通过在生成的文本中查找不区分大小写的匹配项,纠正槽值中的大小写不匹配问题(例如,'nicole' → 'Nicole')。
- 在跨语言生成中,CLASP 使用机器翻译(Opus 或基于 LLM 的模型)后接 Sim-Align,将翻译后的文本与原始解析结构对齐。
- 通过四种失败模式启发式规则对输出进行过滤:槽值缺失、目标不连续、与输入完全一致的复制、输出中包含 'Sentence' 一词。
- 最终生成的合成数据集用于微调较小模型(如 500M 参数),以提升在低资源和零样本跨语言设置下的性能。

实验结果
研究问题
- RQ1基于 LLM 的数据增强是否能显著提升低资源设置下少样本语义解析的性能?
- RQ2通过 LLM 提示实现的跨语言数据生成,在保持跨语言文本-解析对齐方面效果如何?
- RQ3基于机器翻译的语义解析中的主要失败模式是什么?能否通过过滤和恢复机制加以缓解?
- RQ4联合生成文本和解析(GB/TB)是否优于分步生成(RS/TS)以更好地保持语义一致性?
- RQ5从 200 亿参数 LLM 生成的合成数据,能否有效提升 5 亿参数模型在零样本跨语言语义解析上的性能?
主要发现
- 在仅使用 16 个训练样本的英语 Pizza 数据集上,CLASP 将无序精确匹配(Unordered Exact Match)从 80.40 提升至 85.19,提升 4.79 分。
- 在 mTOP 跨语言零样本基准上,与采用槽位对齐的机器翻译相比,CLASP 在精确匹配(Exact Match)上实现了 6.1 分的提升(从 60.3 提升至 66.4)。
- 经筛选的机器翻译输出成功率在 58.3%(印地语)至 86.7%(德语)之间波动,表明跨语言对齐,尤其是远距离语言对,仍面临显著挑战。
- '修复大小写' 恢复机制成功纠正了 13.4% 的 20B 模型生成输出中因大小写问题导致失败的样本。
- 过滤掉输出中包含 'Sentence' 一词的样本(占印地语输出的 13.4%)至关重要,表明提示设计和输出格式约束对可靠生成至关重要。
- 在两个数据集上,CLASP 均优于强基线模型,证明了大型 LLM 生成的合成数据可有效增强小模型在低资源语义解析中的表现。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。