[论文解读] MEWL: Few-shot multimodal word learning with referential uncertainty
本文提出了 MEWL,一个新颖的基准,用于在指代不确定性背景下评估机器在少样本多模态词汇学习方面的能力,其灵感源自人类儿童的快速映射能力。该基准在九项任务中评估了多模态与单模态模型,这些任务反映了核心认知机制——跨情境推理、自举学习与语用学习,揭示了人类与当前模型之间存在显著性能差距,尤其是在关系性与数字词汇学习方面。
Without explicit feedback, humans can rapidly learn the meaning of words. Children can acquire a new word after just a few passive exposures, a process known as fast mapping. This word learning capability is believed to be the most fundamental building block of multimodal understanding and reasoning. Despite recent advancements in multimodal learning, a systematic and rigorous evaluation is still missing for human-like word learning in machines. To fill in this gap, we introduce the MachinE Word Learning (MEWL) benchmark to assess how machines learn word meaning in grounded visual scenes. MEWL covers human's core cognitive toolkits in word learning: cross-situational reasoning, bootstrapping, and pragmatic learning. Specifically, MEWL is a few-shot benchmark suite consisting of nine tasks for probing various word learning capabilities. These tasks are carefully designed to be aligned with the children's core abilities in word learning and echo the theories in the developmental literature. By evaluating multimodal and unimodal agents' performance with a comparative analysis of human performance, we notice a sharp divergence in human and machine word learning. We further discuss these differences between humans and machines and call for human-like few-shot word learning in machines.
研究动机与目标
- 为解决当前缺乏系统性、发展心理学基础的评估方法来衡量机器中类人少样本词汇学习的问题。
- 设计一个基准,捕捉人类词汇学习中的核心认知机制,包括跨情境推理、自举学习与语用推理。
- 评估多模态与单模态模型在从极少且模糊的视觉-语言上下文中学习词汇意义方面的能力。
- 通过将机器性能与人类在相同任务上的表现直接对比,揭示当前学习范式中的根本性差距。
- 激励未来研究,推动构建能够像儿童一样在不确定性中学习词汇的机器,通过心理学启发的学习基准。
提出的方法
- MEWL 在 CLEVR 环境中构建,以生成结构化、多样化的视觉场景,并控制指代模糊性。
- 每个任务提供六张上下文图像和一个新词表达(例如,'daxy' 代表一个绿色圆柱体),要求智能体在查询图像中识别出正确的指代对象。
- 设计了九项不同的任务,用于探测:基本属性命名、关系性词汇学习、数字词汇学习以及语用性词汇学习。
- 该基准强制实施少样本学习,仅提供极少监督,模拟儿童对词-指代对的被动、跨情境暴露。
- 模型的评估基于其从共现模式和上下文线索中推断词义的能力,即使在存在指代不确定性的情况下亦需有效。
- 招募人类参与者作为性能基线,以实现与机器模型的直接对比。

实验结果
研究问题
- RQ1当前的多模态与单模态模型能否在指代不确定性下实现类人少样本词汇学习?
- RQ2模型在需要跨情境推理、自举学习与语用推理的任务中表现如何——这些是人类词汇学习中的核心机制?
- RQ3大语言模型与视觉-语言模型在无显式监督下,对新词义的泛化能力如何?
- RQ4与人类表现相比,当前模型在关系性与数字词汇学习中的关键失败模式是什么?
- RQ5单模态大语言模型能否在缺乏感知基础的情况下学习概念角色与词汇意义?其表现与多模态模型相比如何?
主要发现
- 多模态视觉-语言模型,包括 Flamingo 等大规模模型,在大多数 MEWL 任务中表现显著不佳,尤其在关系性与数字词汇学习方面。
- 即使是最先进的视觉-语言模型(Flamingo)也远未达到人类表现水平,表明在少样本词汇学习机制上存在根本性错位。
- 单模态大语言模型在某些子任务(如属性命名)中表现出有限的少样本词汇学习能力,但在更复杂的关系性与语用性任务中完全失败。
- 人类参与者始终优于所有机器模型,尤其在需要不确定性推理与社会-语用推理的任务中表现突出。
- 在涉及组合性、关系理解与概念关联的任务中,性能差距最为显著——这些是类人学习的关键组成部分。
- 结果表明,当前的预训练范式未能捕捉人类词汇学习的核心方面,例如从极少且模糊数据中进行稳健推理的能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。