[论文解读] Diverse Demonstrations Improve In-context Compositional Generalization
本文提出在上下文学习中使用多样化的演示样例,以提升语义解析中的组合泛化能力,即模型需处理已知元素的未见过组合。通过采用一种基于覆盖度的策略——Cover-LS,选择能共同覆盖所有必要程序结构的演示样例,该方法在组合泛化基准测试上,无论是在纯上下文学习还是与微调结合时,性能最高提升达23个百分点。
In-context learning has shown great success in i.i.d semantic parsing splits, where the training and test sets are drawn from the same distribution. In this setup, models are typically prompted with demonstrations that are similar to the input utterance. However, in the setup of compositional generalization, where models are tested on outputs with structures that are absent from the training set, selecting similar demonstrations is insufficient, as often no example will be similar enough to the input. In this work, we propose a method to select diverse demonstrations that aims to collectively cover all of the structures required in the output program, in order to encourage the model to generalize to new structures from these demonstrations. We empirically show that combining diverse demonstrations with in-context learning substantially improves performance across three compositional generalization semantic parsing datasets in the pure in-context learning setup and when combined with finetuning.
研究动机与目标
- 为解决在组合泛化设置中上下文学习失败的问题,即没有单个训练样例与测试输入相似。
- 通过增加演示样例集的多样性来提升模型泛化能力,确保覆盖所有必需的程序结构。
- 开发一种不仅基于与输入相似性,更基于结构互补性以覆盖目标程序的演示样例选择方法。
- 评估在纯上下文学习与微调设置下,多样演示样例的有效性。
提出的方法
- 提出 Cover-LS,一种基于覆盖度的检索方法,可识别目标输出中的局部程序结构,并选择能共同覆盖这些结构的演示样例。
- 利用模型预测识别目标程序中的潜在子结构,并检索覆盖这些子结构的样例,从而提升结构多样性。
- 在候选演示样例上使用束搜索(beam search),以最大化对预测局部结构的覆盖度,同时保持多样性。
- 采用基于检索的方法,优先选择具有不同程序结构的演示样例,且不依赖于与输入的相似性。
- 通过在训练过程中让模型将演示样例作为输入,并引入噪声演示样例以防止过度依赖,将该方法与微调结合。
- 同时使用神经与非神经检索器来选择演示样例,通过在开发集上的性能评估来选择最优检索策略。
实验结果
研究问题
- RQ1选择能共同覆盖所需程序结构的多样化演示样例,是否能提升在组合泛化任务上的上下文学习性能?
- RQ2在少样本语义解析中,基于覆盖度的演示样例选择是否优于基于相似性的选择?
- RQ3当与微调结合时,多样化演示样例在纯上下文学习与微调设置下的性能影响如何?
- RQ4多样化演示样例是否能减少实现有效泛化所需的样例数量?
- RQ5演示样例中的结构多样性是否能提升对困难、分布外样例的性能表现?
主要发现
- 与基于相似性的基线方法相比,Cover-LS 方法在 SMCalFlow-CS 数据集上的性能最高提升了 23.2 个百分点。
- 在 H-CLUTRR 和 GeoQuery-CS 数据集上,多样化演示样例在所有设置下均带来一致的性能提升,包括纯上下文学习设置。
- 该方法减少了实现有效泛化所需的演示样例数量,表明多样性可实现更高效的少样本学习。
- 性能提升在困难样例上尤为显著,表明对未见过的程序结构具有更好的泛化能力。
- 该方法在多个组合语义解析基准测试上均取得了最先进(SOTA)的性能表现,无论是否结合微调。
- 基于覆盖度的多样性(Cover-LS)优于仅基于样例差异性的多样性,证明了结构相关性的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。