[论文解读] BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing
BenchCLAMP 是一个用于通过上下文无关语法的约束解码来评估语言模型句法和语义解析性能的基准。它实现了对八种模型的可靠性能比较,表明经过微调的编码器-解码器模型结合约束解码在低资源设置下尤其能实现最先进水平的结果。
Recent work has shown that generation from a prompted or fine-tuned language model can perform well at semantic parsing when the output is constrained to be a valid semantic representation. We introduce BenchCLAMP, a Benchmark to evaluate Constrained LAnguage Model Parsing, that includes context-free grammars for seven semantic parsing datasets and two syntactic parsing datasets with varied output representations, as well as a constrained decoding interface to generate only valid outputs covered by these grammars. We provide low, medium, and high resource splits for each dataset, allowing accurate comparison of various language models under different data regimes. Our benchmark supports evaluation of language models using prompt-based learning as well as fine-tuning. We benchmark eight language models, including two GPT-3 variants available only through an API. Our experiments show that encoder-decoder pretrained language models can achieve similar performance or surpass state-of-the-art methods for syntactic and semantic parsing when the model output is constrained to be valid.
研究动机与目标
- 解决在句法结构预测任务(如解析)上缺乏标准化评估的问题。
- 通过提供可重用的语法和约束解码接口,降低开发者评估语言模型在解析任务上性能的门槛。
- 在不同数据规模的多样化解析数据集上,比较基于提示学习与微调的性能表现。
- 研究约束解码、上下文编码和提示工程对解析准确率的影响。
- 建立在句法和语义解析中使用语言模型生成有效输出的最佳实践。
提出的方法
- 设计一个包含九个解析数据集的基准,涵盖七个语义解析和两个句法解析任务,每个任务均配有上下文无关语法以生成有效输出。
- 为每个数据集提供低、中、高资源划分,以评估不同数据规模下的性能表现。
- 实现一个约束解码接口,利用提供的上下文无关语法规则确保仅生成语法正确的输出。
- 通过将语法集成到自回归和序列到序列模型的解码流程中,同时支持基于提示的学习和微调。
- 使用基于检索的提示工程方法(如 BM25 和句子嵌入,例如 SentenceT5-xxl)以提升少样本提示的性能。
- 使用任务特定指标(如 LISPRESS 匹配准确率和语义及句法解析任务的精确匹配率)评估模型性能。
实验结果
研究问题
- RQ1通过上下文无关语法的约束解码,在不同语言模型和数据规模下如何提升解析性能?
- RQ2在低资源设置下,少样本提示与微调对解析准确率的相对影响如何?
- RQ3不同的提示工程策略(如示例排序和上下文包含)如何影响少样本模型的性能?
- RQ4与随机或启发式选择相比,基于检索的提示选择方法在多大程度上提升了少样本提示的准确率?
- RQ5从部分训练数据中进行语法归纳,如何影响低资源场景下约束解码的性能?
主要发现
- 经过微调的编码器-解码器模型(如 T5 和 BART)在应用约束解码后,在所有解析数据集上的性能可与或超过最先进方法。
- 在低资源设置下,约束解码带来的性能提升最大,相比无约束生成,准确率提升高达 5–7%。
- 对于少样本提示模型,约束解码至关重要——若无约束解码,模型在复杂任务(如短语结构解析和依存解析)中往往无法生成有效解析。
- 将最相关示例置于生成头附近提示位置的提示工程策略,能显著提升少样本性能,尤其在低数据量场景下。
- 在低资源设置下,SentenceT5-xxl 在提示检索中表现优于 BM25 和其他句子嵌入模型,在 SMCalFlow 数据集上达到 39.3% 的准确率。
- 使用完整训练集生成的语法规则,性能略优于从低资源划分中生成的语法规则,后者在低资源设置下准确率下降约 1–2%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。