[论文解读] COGS: A Compositional Generalization Challenge Based on Semantic Interpretation
COGS 是一个语义解析基准,通过引入系统性的分布外差距(如熟悉词汇和句法结构的新组合),旨在评估自然语言处理模型的组合泛化能力,要求模型在训练数据之外进行泛化。尽管在分布内测试中准确率接近完美(96–99%),但 Transformer 和 LSTM 模型的组合泛化准确率仅为 16–35%,且对随机种子高度敏感,暴露出其在组合泛化能力上的根本性局限。
Natural language is characterized by compositionality: the meaning of a complex expression is constructed from the meanings of its constituent parts. To facilitate the evaluation of the compositional abilities of language processing architectures, we introduce COGS, a semantic parsing dataset based on a fragment of English. The evaluation portion of COGS contains multiple systematic gaps that can only be addressed by compositional generalization; these include new combinations of familiar syntactic structures, or new combinations of familiar words and familiar structures. In experiments with Transformers and LSTMs, we found that in-distribution accuracy on the COGS test set was near-perfect (96--99%), but generalization accuracy was substantially lower (16--35%) and showed high sensitivity to random seed ($\pm$6--8%). These findings indicate that contemporary standard NLP models are limited in their compositional generalization capacity, and position COGS as a good way to measure progress.
研究动机与目标
- 为解决现有基准在测试自然语言处理中组合泛化能力时缺乏鲁棒性、仅依赖简单模式匹配的问题。
- 评估现代神经架构(如 Transformer 和 LSTM)是否能够对训练中未见的熟悉句法结构与词汇的新组合实现组合泛化。
- 识别暴露当前模型归纳偏置局限性的结构与词汇泛化差距。
- 提供一个基于形式语义学的基准,采用基于 lambda 演算的语义表示,以确保语言上的合理性与组合结构的忠实性。
提出的方法
- COGS 基于英语的一个片段构建语义解析数据集,其训练集与测试集在结构和词汇组合上系统性地不同。
- 测试集包含系统性差距,如新组合的词汇-结构搭配、熟悉短语在新句法角色中的使用,以及右分支结构中高达 12 层的深层嵌套。
- 语义表示采用 lambda 演算生成,受形式语义学启发,以确保组合结构与语义的一致性。
- 模型通过序列到序列学习训练,将自然语言句子映射到其对应的语义形式,将语义解析视为序列到序列任务。
- 泛化任务包括:将熟悉词汇置于新句法角色中(如将名词短语置于主语位置作为宾语)、动词论元结构的交替变化,以及在未观察到的句法位置中对介词短语的修饰。
- 数据集包含受控变化,以测试结构泛化(如新短语嵌套深度)和词汇泛化(如新词汇-结构配对),所有结构均基于形式语法。
实验结果
研究问题
- RQ1标准神经语言模型(如 Transformer 和 LSTM)能否对训练中未见的熟悉词汇与句法结构的新组合实现组合泛化?
- RQ2泛化性能在不同随机种子下的变化程度如何,反映出学习组合归纳偏置的不稳定性?
- RQ3结构泛化(如新句法结构组合或熟悉短语的新句法角色)是否比词汇泛化(如新词汇-结构配对)更具挑战性?
- RQ4尽管人类在类似深度下处理能力会下降,模型是否仍能泛化到更深的句法嵌套层次(如深度 12)?
- RQ5如果训练数据中缺少某些句法结构(如主语位置的介词短语修饰),即使其意义可组合推导,模型是否仍无法泛化到这些结构?
主要发现
- Transformer 和 LSTM 在 COGS 上的分布内测试准确率始终很高,范围在 96% 到 99% 之间,表明其在已见模式上的强大性能。
- 分布外泛化准确率显著降低,范围在 16% 到 35% 之间,凸显了组合泛化能力的严重缺陷。
- 泛化性能对随机种子高度敏感,各次运行的标准差为 6–8%,表明组合归纳偏置的学习极不稳定。
- 结构泛化(如句法结构的新组合或熟悉短语的新句法角色)比仅涉及新词汇-结构配对的词汇泛化更具挑战性。
- 模型在泛化到更深嵌套层次(如深度 12)时表现极差,深度 3 时准确率接近零,表明缺乏稳健的结构归纳偏置。
- 结果表明,当前标准 NLP 模型即使从头开始在受控语法上训练,也缺乏实现人类式系统性的组合归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。