[论文解读] QAmeleon: Multilingual QA with Only 5 Examples
QAmeleon 提出了一种少样本、提示微调的方法,仅使用每种语言五个标注示例即可生成多语言问答数据。通过微调大型预训练语言模型以合成高质量的问答对,其性能达到英语单语模型与完全监督模型之间差距的60%以内,优于基于翻译的基线方法和零样本方法,在低资源设置下表现更优。
The availability of large, high-quality datasets has been one of the main drivers of recent progress in question answering (QA). Such annotated datasets however are difficult and costly to collect, and rarely exist in languages other than English, rendering QA technology inaccessible to underrepresented languages. An alternative to building large monolingual training datasets is to leverage pre-trained language models (PLMs) under a few-shot learning setting. Our approach, QAmeleon, uses a PLM to automatically generate multilingual data upon which QA models are trained, thus avoiding costly annotation. Prompt tuning the PLM for data synthesis with only five examples per language delivers accuracy superior to translation-based baselines, bridges nearly 60% of the gap between an English-only baseline and a fully supervised upper bound trained on almost 50,000 hand labeled examples, and always leads to substantial improvements compared to fine-tuning a QA model directly on labeled examples in low resource settings. Experiments on the TyDiQA-GoldP and MLQA benchmarks show that few-shot prompt tuning for data synthesis scales across languages and is a viable alternative to large-scale annotation.
研究动机与目标
- 为解决高质量多语言问答数据集稀缺的问题,尤其是低资源语言的稀缺问题。
- 通过利用合成数据生成,减少对昂贵大规模标注的依赖。
- 在不依赖翻译伪影的前提下,提升低资源设置下的多语言问答性能。
- 评估提示微调在多语言问答数据合成中的有效性。
- 提供一种可扩展、数据高效的替代方案,以替代完整数据集标注或基于翻译的训练。
提出的方法
- 仅使用每种目标语言五个黄金标注示例,对大型预训练语言模型(PLM)进行提示微调。
- 利用提示微调后的 PLM 自动生成合成的多语言问答数据,包括问题、答案和源文本段落。
- 在 PLM 生成的合成数据上微调问答模型。
- 采用结合英文指令与目标语言样本的多语言提示设计,以提升零样本和少样本泛化能力。
- 在 TyDiQA-GoldP 和 MLQA 基准上验证性能,以精确匹配(EM)为主要指标。
- 在公开发布前,由人工评估者对生成的数据进行筛选,以剔除不当或有偏见的内容。
实验结果
研究问题
- RQ1仅使用每种语言五个示例进行提示微调,能否生成使多语言问答性能强劲的合成问答数据?
- RQ2在低资源多语言设置下,QAmeleon 与基于翻译的微调方法(如 translate-train)相比表现如何?
- RQ3通过提示微调的 PLM 进行合成数据生成,是否优于零样本或提示工程基线方法?
- RQ4QAmeleon 的性能在不同语言和数据集上如何扩展?
- RQ5少样本示例数量对合成数据质量和下游问答准确率有何影响?
主要发现
- 在 TyDiQA-GoldP 上,QAmeleon 相较于英语单语基线模型实现了 12% 的绝对准确率提升,展现出强劲的少样本性能。
- 它几乎弥补了英语单语基线模型与在约 50,000 个手工标注示例上训练的完全监督模型之间性能差距的 60%。
- 在 TyDiQA-GoldP 上,QAmeleon 相较于具有竞争力的翻译基线方法高出 4% 的绝对 EM,显示出对 translate-train 方法的优越性。
- 当将人工标注示例从 50 个增加到 100 个时,性能并未显著提升,表明在极少标注下具有极高的数据效率。
- 该方法在低资源语言上持续优于直接微调,并且在使用相同少样本示例时优于提示工程方法。
- 发布的合成数据集包含 47,173 个经人工审核的高质量样本,其中 89% 的数据用于实验,确保了安全性和可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。