Skip to main content
QUICK REVIEW

[论文解读] DevBench: A multimodal developmental benchmark for language learning

Alvin Wei Ming Tan, Sunny Yu|arXiv (Cornell University)|Jun 14, 2024
Innovative Teaching and Learning MethodsPsychology被引用 3
一句话总结

DevBench 引入了一个多模态基准,包含七个语言任务,用于评估儿童和成人在词汇、句法和语义方面的能力,使视觉-语言模型能够与人类发展轨迹进行直接比较。结果表明,模型性能与人类相似性之间存在强烈相关性,更大的模型和训练时间更长的模型在发展进程上更接近人类响应模式,尤其是在句法和语义任务中。

ABSTRACT

How (dis)similar are the learning trajectories of vision-language models and children? Recent modeling work has attempted to understand the gap between models' and humans' data efficiency by constructing models trained on less data, especially multimodal naturalistic data. However, such models are often evaluated on adult-level benchmarks, with limited breadth in language abilities tested, and without direct comparison to behavioral data. We introduce DevBench, a multimodal benchmark comprising seven language evaluation tasks spanning the domains of lexical, syntactic, and semantic ability, with behavioral data from both children and adults. We evaluate a set of vision-language models on these tasks, comparing models and humans not only on accuracy but on their response patterns. Across tasks, models exhibit variation in their closeness to human response patterns, and models that perform better on a task also more closely resemble human behavioral responses. We also examine the developmental trajectory of OpenCLIP over training, finding that greater training results in closer approximations to adult response patterns. DevBench thus provides a benchmark for comparing models to human language development. These comparisons highlight ways in which model and human language learning processes diverge, providing insight into entry points for improving language models.

研究动机与目标

  • 为解决缺乏使用儿童级数据和类人评估方法评估语言模型的发展基准的问题。
  • 创建一个能够捕捉词汇、句法和语义领域语言发展动态范围的基准。
  • 实现模型与人类响应模式的直接比较,而非依赖于绝对准确率指标。
  • 评估在发展数据上训练的视觉-语言模型在多大程度上能逼近人类语言学习轨迹。
  • 识别模型行为中的差距,特别是与儿童语言习得相比在歧义解析方面的差异。

提出的方法

  • DevBench 包含七个多模态语言评估任务,旨在反映语言习得中的发展进程。
  • 每个任务均收集2至5岁儿童和成人的行为数据,采用非语言响应方式(如注视或指向)以减少认知负荷。
  • 模型性能不仅通过准确率评估,还通过模型logits与人类响应分布之间的优化KL散度,衡量与人类响应模式的相似性。
  • 在DevBench上评估了多样化的视觉-语言模型,包括最先进模型、小型模型以及发展训练模型。
  • 分析OpenCLIP的中间训练检查点,以追踪模型与人类相似性随时间的变化,揭示发展趋势。
  • 该基准设计具有可扩展性,采用标准化格式,以鼓励未来新增任务和多语言数据的贡献。
Figure 1: Tasks in DevBench arranged by linguistic domain, along with the ages for which corresponding human data are available. A: Adult.
Figure 1: Tasks in DevBench arranged by linguistic domain, along with the ages for which corresponding human data are available. A: Adult.

实验结果

研究问题

  • RQ1视觉-语言模型在不同语言能力上的响应模式与儿童和成人相比如何?
  • RQ2模型规模或训练时长在多大程度上影响其与人类发展响应模式的相似性?
  • RQ3在发展上更真实的训练数据上训练的模型,是否能比标准模型更好地逼近人类语言学习?
  • RQ4模型在处理模糊或语境复杂的语言输入时,与儿童相比存在哪些差异?
  • RQ5模型与人类之间的响应模式相似性在训练过程中如何演变?是否反映了已知的发展轨迹?

主要发现

  • 模型与人类响应模式的相似性与模型准确率强烈相关,表明性能更高的模型也更接近人类行为。
  • 更大的模型以及训练时间更长的模型在句法和语义任务中与成人响应模式的对齐程度更高。
  • OpenCLIP模型在训练过程中表现出发展轨迹,中间检查点的响应模式相似性逐渐增加,尽管并非在所有任务中都一致。
  • 模型在解析模糊输入方面不如人类有效,表明其在语用推理和不确定性处理方面存在关键差异。
  • 该基准揭示了当前模型在人类相似性方面存在显著差异,凸显歧义解析和发育轨迹建模是未来改进的关键领域。
  • DevBench 实现了方法严谨的模型与儿童之间的直接比较,提供了一个评估框架,不仅关注准确率,还关注发展合理性。
Figure 2: Sample trials for each task in DevBench .
Figure 2: Sample trials for each task in DevBench .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。