[论文解读] CURI: A Benchmark for Productive Concept Learning Under Uncertainty
CURI 引入了一种新颖的少样本、元学习基准,用于在不确定条件下评估生成性与系统性概念学习,强调对关系概念、布尔运算、变量绑定和计数的组合推理。该基准定义了一个与模型无关的‘组合性差距’,用于衡量泛化难度,揭示了当前视觉、语言和音频模态模型在该方面仍有显著的改进空间。
Humans can learn and reason under substantial uncertainty in a space of infinitely many concepts, including structured relational concepts ("a scene with objects that have the same color") and ad-hoc categories defined through goals ("objects that could fall on one's head"). In contrast, standard classification benchmarks: 1) consider only a fixed set of category labels, 2) do not evaluate compositional concept learning and 3) do not explicitly capture a notion of reasoning under uncertainty. We introduce a new few-shot, meta-learning benchmark, Compositional Reasoning Under Uncertainty (CURI) to bridge this gap. CURI evaluates different aspects of productive and systematic generalization, including abstract understandings of disentangling, productive generalization, learning boolean operations, variable binding, etc. Importantly, it also defines a model-independent "compositionality gap" to evaluate the difficulty of generalizing out-of-distribution along each of these axes. Extensive evaluations across a range of modeling choices spanning different modalities (image, schemas, and sounds), splits, privileged auxiliary concept information, and choices of negatives reveal substantial scope for modeling advances on the proposed task. All code and datasets will be available online.
研究动机与目标
- 解决现有基准在评估开放概念空间中系统性泛化与不确定条件下的推理能力方面的不足。
- 模拟人类般的生成性概念学习——即在已知概念基础上生成新颖组合——超越固定类别分类任务。
- 引入一个基准,捕捉概念归纳中的模糊性与信息不足,即多个假设可解释相同观测结果。
- 通过与模型无关的‘组合性差距’度量,量化分布外泛化的难度。
- 支持跨多种模态(图像、符号图式、声音)的评估,并采用系统性测试划分以评估组合泛化能力。
提出的方法
- 该基准定义了元学习任务,其中模型从少量正负样本的支持集中推断一个概念。
- 通过变量、量词、函数和运算符的正式语法生成概念,以支持组合性、关系性推理。
- 任务要求基于推断出的概念对查询集样本进行分类,并采用系统性训练-测试划分,以评估对新颖组合的泛化能力。
- ‘组合性差距’通过理想贝叶斯学习者(可访问全部假设)与仅限元训练假设的受限学习者之间的性能差异来计算。
- 在多种模态(图像、符号图式、场景的声音渲染)上评估模型,支持跨模态分析。
- 基准包含针对内在/外在属性、布尔运算、计数、变量绑定以及概念/实例级泛化的划分。
实验结果
研究问题
- RQ1模型在组合性、关系性空间中对原子概念(如颜色、形状、数量)的新颖组合泛化能力如何?
- RQ2当多个合理概念可解释相同数据时,模型在处理不确定性方面的表现如何?
- RQ3组合性差距在多大程度上量化了概念学习中分布外泛化的难度?
- RQ4不同模型架构与模态表示(图像、图式、声音)如何影响模型在不确定条件下的组合推理性能?
- RQ5辅助概念信息或特权知识是否能提升泛化能力?这种提升在不同划分中表现如何?
主要发现
- 组合性差距表明,即使理想贝叶斯学习者在分布外泛化方面也面临困难,揭示了组合推理中的根本性挑战。
- 在最困难的划分(含困难负样本的计数)中,表现最佳的模型(图式 + 关系网络)仅达到 28.3% mAP,表明仍有巨大改进空间。
- 使用符号图式的模型在所有划分中均优于基于图像的模型,表明结构化表示更有利于支持组合推理。
- 声音模态中的性能显著下降,最佳模型仅达到 17.5% mAP,凸显了基于声音的组合理解面临挑战。
- ‘绑定’划分(颜色与形状)表现出最高的性能方差,表明变量绑定是特别困难的泛化轴。
- ‘概念 IID’与‘实例 IID’划分的总体性能最高(最高达 69.0% mAP),表明基于身份的泛化比组合或结构泛化更容易。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。