Skip to main content
QUICK REVIEW

[论文解读] Generate-and-Retrieve: use your predictions to improve retrieval for semantic parsing

Yury Zemlyanskiy, Michiel de Jong|arXiv (Cornell University)|Sep 29, 2022
Natural Language Processing Techniques被引用 8
一句话总结

本文提出了一种名为 Generate-and-Retrieve (GandR) 的新型检索方法,用于低资源语义解析,通过不仅基于输入相似性,还基于模型初步预测与范例输出之间的相似性来检索训练范例,从而提升模型性能。GandR 首先基于输入检索生成初步预测,然后检索输出相似的范例以优化最终预测,在 MTOP 和 TOPv2 基准测试中取得当前最优结果。

ABSTRACT

A common recent approach to semantic parsing augments sequence-to-sequence models by retrieving and appending a set of training samples, called exemplars. The effectiveness of this recipe is limited by the ability to retrieve informative exemplars that help produce the correct parse, which is especially challenging in low-resource settings. Existing retrieval is commonly based on similarity of query and exemplar inputs. We propose GandR, a retrieval procedure that retrieves exemplars for which outputs are also similar. GandRfirst generates a preliminary prediction with input-based retrieval. Then, it retrieves exemplars with outputs similar to the preliminary prediction which are used to generate a final prediction. GandR sets the state of the art on multiple low-resource semantic parsing tasks.

研究动机与目标

  • 为解决现有检索方法在低资源语义解析中的局限性,即仅依赖输入相似性,可能遗漏语义相关的范例。
  • 探究输出相似性是否能作为输入相似性的互补信号,用于检索具有信息量的训练范例。
  • 通过将基于输出的检索整合到序列到序列生成流程中,提升低资源设置下的模型泛化能力和预测准确性。
  • 证明输出空间相似性,尤其是在结构化输出(如语义解析)中,相比仅依赖词汇输入相似性,能实现更有效的检索。

提出的方法

  • GandR 首先执行基于输入的检索,利用序列到序列模型生成初步预测。
  • 然后计算一个混合相关性得分,平衡输入相似性(通过 TF-IDF 计算)和输出相似性(初步预测与范例输出之间)。
  • 根据该混合得分检索范例,结合输入和输出信号以提升检索质量。
  • 最终预测通过将前 k 个检索到的范例(输入-输出对)附加到输入上,并将增强后的输入输入模型生成。
  • 在训练过程中,检索结果按相关性排名的几何分布采样,温度超参数控制探索程度。
  • 该方法以 T5 作为基础模型,并应用检索增强生成技术,以提升低资源设置下的泛化能力。

实验结果

研究问题

  • RQ1在低资源语义解析中,将输出相似性纳入检索过程是否能提升性能?
  • RQ2当输入在词汇上不相似但输出在语义上相似时,基于输出的检索是否是基于输入检索的互补信号?
  • RQ3使用初步预测引导检索是否能带来更信息量的范例并提升最终预测质量?
  • RQ4在模板召回率和精确匹配准确率方面,混合检索与仅基于输入或仅基于输出的检索相比表现如何?
  • RQ5在何种情况下基于输出的检索会导致错误预测?其失败模式是什么?

主要发现

  • GandR 在 MTOP 和 TOPv2 基准测试中达到当前最优性能,在 MTOP 25% 上取得 80.1% 的精确匹配分数,在 TOPv2 W 上达到 80.5%。
  • 在 MTOP boot 基准测试中,GandR 取得 76.4% 的精确匹配率,比之前的 SOTA 方法(CASPER)高出 3.1 个百分点。
  • 混合相似性(输入 + 输出)相比仅基于输入的检索,带来了更高的模板召回率,表明对相关语义模式的覆盖更全面。
  • 该方法在低资源设置下最为有效,在高资源设置(如完整 MTOP 和 TOPv2)中收益递减。
  • 错误分析显示,即使词汇重叠较低,GandR 仍能成功检索到语义相关的范例,例如当仅依赖 TF-IDF 输入相似性时,会因词汇重叠而检索到无关示例。
  • 尽管存在少数情况,输出相似性会干扰对更匹配输入范例的检索,但整体性能提升证明了基于输出检索的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。