Skip to main content
QUICK REVIEW

[论文解读] PICARD: Parsing Incrementally for Constrained Auto-Regressive Decoding from Language Models

Torsten Scholak, Nathan Schucher|arXiv (Cornell University)|Sep 10, 2021
Natural Language Processing Techniques被引用 4
一句话总结

PICARD 是一种新颖且轻量级的方法,用于在大型语言模型中进行约束自回归解码,通过增量解析在生成过程中拒绝无效标记,显著提高输出正确性。它使微调后的 T5 模型在 Spider 和 CoSQL 等文本到 SQL 基准测试中实现最先进性能,且无需架构更改或使用大束搜索大小。

ABSTRACT

Large pre-trained language models for textual data have an unconstrained output space; at each decoding step, they can produce any of 10,000s of sub-word tokens. When fine-tuned to target constrained formal languages like SQL, these models often generate invalid code, rendering it unusable. We propose PICARD (code and trained models available at https://github.com/ElementAI/picard), a method for constraining auto-regressive decoders of language models through incremental parsing. PICARD helps to find valid output sequences by rejecting inadmissible tokens at each decoding step. On the challenging Spider and CoSQL text-to-SQL translation tasks, we show that PICARD transforms fine-tuned T5 models with passable performance into state-of-the-art solutions.

研究动机与目标

  • 解决从预训练语言模型生成语法和语义上有效的形式语言输出(如 SQL)的挑战。
  • 克服现有约束解码方法所需自定义词汇表、模型架构或极大约束束搜索大小的局限性。
  • 在不重新训练或微调的情况下,实现标准预训练语言模型解码器的高精度、正确 SQL 生成。
  • 提供一种即插即用的解决方案,兼容现有的束搜索和贪婪解码算法,适用于自回归模型。

提出的方法

  • 引入使用单子组合子的增量解析,以在每个解码步骤验证部分标记序列。
  • 基于 SQL 模式和语法规则,应用一系列验证检查——词法分析、无保护的解析和带保护的解析。
  • 将每个步骤的解码限制在 top-k 最高概率的标记,并为无效标记分配 -∞ 分数,从而有效过滤掉它们。
  • 支持四种操作模式:关闭、词法分析、无保护解析和带保护解析,验证强度逐步增强。
  • 通过修改标记分数而非改变模型架构或词汇表,与标准自回归解码无缝集成。
  • 利用模式信息(表名和列名)验证标识符,确保解析过程中的引用正确性。

实验结果

研究问题

  • RQ1是否可以使用增量解析在不修改架构的情况下提升预训练语言模型自回归解码的正确性?
  • RQ2在性能和效率方面,每步解码中集成解析约束与事后过滤束假设相比有何差异?
  • RQ3Picard 在 Spider 和 CoSQL 等文本到 SQL 任务中对标准 T5 模型性能的提升程度如何?
  • RQ4不同验证模式(词法分析、带/不带保护的解析)以及束搜索大小对最终输出质量的影响是什么?
  • RQ5Picard 是否能使更小的 T5 模型达到与未使用 Picard 的更大模型相当的最先进性能?

主要发现

  • 启用 Picard 后,T5-Base 模型在 Spider 数据集上的表现优于未使用 Picard 的 T5-Large 模型,展现出显著的效率优势。
  • 在 Spider 上,启用 Picard 的 T5-3B 模型达到最先进性能,开发集上问题匹配准确率达到 56.9%,交互匹配准确率达到 24.2%。
  • 在 CoSQL 上,Picard 使 T5-3B 模型在测试集上达到 54.6% 的问题匹配准确率和 23.7% 的交互匹配准确率,与或超过先前最先进系统。
  • Picard 的性能提升在束搜索大小从 1 增加到 2 时最为显著,束搜索大小超过 4 后收益递减。
  • 每步进行的增量验证比仅在最后阶段验证显著更有效,尤其在小束搜索大小下。
  • Picard 处理的 top-k 标记数量对性能影响较小,且对更大模型(如 T5-3B)的影响最小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。