[논문 리뷰] DevBench: A multimodal developmental benchmark for language learning
DevBench는 어린이와 성인의 어휘적, 문법적, 의미적 능력을 평가하는 일곱 가지 언어 과제를 포함한 다중모odal 벤치마크를 도입하여, 시각-언어 모델과 인간의 발달 궤적을 직접 비교할 수 있도록 한다. 이는 모델 성능과 인간 유사성 간의 강한 상관관계를 드러내며, 더 큰 모델과 더 긴 훈련 기간을 거친 모델일수록 특히 발달적 진행 양상에서 인간의 반응 패턴에 더 가까이 맞춰진다는 것을 보여준다.
How (dis)similar are the learning trajectories of vision-language models and children? Recent modeling work has attempted to understand the gap between models' and humans' data efficiency by constructing models trained on less data, especially multimodal naturalistic data. However, such models are often evaluated on adult-level benchmarks, with limited breadth in language abilities tested, and without direct comparison to behavioral data. We introduce DevBench, a multimodal benchmark comprising seven language evaluation tasks spanning the domains of lexical, syntactic, and semantic ability, with behavioral data from both children and adults. We evaluate a set of vision-language models on these tasks, comparing models and humans not only on accuracy but on their response patterns. Across tasks, models exhibit variation in their closeness to human response patterns, and models that perform better on a task also more closely resemble human behavioral responses. We also examine the developmental trajectory of OpenCLIP over training, finding that greater training results in closer approximations to adult response patterns. DevBench thus provides a benchmark for comparing models to human language development. These comparisons highlight ways in which model and human language learning processes diverge, providing insight into entry points for improving language models.
연구 동기 및 목표
- 어린이 수준의 데이터와 인간 유사 평가 방법을 사용하여 언어 모델을 평가하는 발달 기반 벤치마크의 부족을 해결하기 위해.
- 어휘적, 문법적, 의미적 영역에서 언어 발달의 동적 범위를 포괄하는 벤치마크를 만들기 위해.
- 절대 정확도 지표에 의존하는 대신, 모델과 인간의 반응 패턴 간 직접 비교를 가능하게 하기 위해.
- 발달 데이터로 훈련된 시각-언어 모델이 인간의 언어 학습 궤적을 얼마나 잘 모방하는지 평가하기 위해.
- 특히 모호성 해소 측면에서 어린이의 언어 습득과 비교했을 때 모델 행동의 격차를 규명하기 위해.
제안 방법
- DevBench는 언어 습득의 발달적 진행을 반영하도록 설계된 일곱 가지 다중모달 언어 평가 과제로 구성되어 있다.
- 각 과제는 어린이(2–5세)와 성인으로부터 행동 데이터를 수집하며, 인지적 부담을 줄이기 위해 시각적 반응 방식(예: 응시 또는 가리키기)을 사용한다.
- 모델 성능 평가는 정확도 외에도, 모델 로짓과 인간 반응 분포 간 최적화된 KL 발산을 사용하여 인간 반응 패턴과의 유사도로 평가된다.
- 최첨단 모델, 작은 모델, 발달 기반으로 훈련된 모델을 포함한 다양한 시각-언어 모델이 DevBench에서 평가된다.
- OpenCLIP의 중간 훈련 체크포인트를 분석하여 모델-인간 유사성의 시간적 변화를 추적함으로써 발달적 경향을 파악한다.
- 벤치마크는 확장 가능하도록 설계되어 있으며, 표준화된 형식을 통해 향후 새로운 과제와 다국어 데이터 기여를 장려한다.

실험 결과
연구 질문
- RQ1시각-언어 모델은 다양한 언어 능력에서 어린이와 성인의 반응 패턴과 어떻게 비교되는가?
- RQ2모델 크기나 훈련 기간이 인간의 발달적 반응 패턴과의 유사성에 어느 정도 영향을 미치는가?
- RQ3발달적으로 현실적인 데이터로 훈련된 모델은 표준 모델보다 인간의 언어 학습을 더 잘 모방할 수 있는가?
- RQ4모델는 모호하거나 맥락이 복잡한 언어 입력을 다룰 때 어린이와 어떻게 다름을 보이는가?
- RQ5훈련 과정에서 모델과 인간 간의 반응 패턴 유사성은 어떻게 변화하며, 이는 알려진 발달 궤적을 반영하는가?
주요 결과
- 모델-인간 반응 패턴 유사성은 모델 정확도와 강하게 상관되어 있으며, 성능이 높을수록 인간 행동과 더 유사하다는 것을 시사한다.
- 더 큰 모델과 더 긴 훈련 기간을 거친 모델일수록 특히 문법적 및 의미적 과제에서 성인 반응 패턴과 더 가까이 맞춰진다.
- OpenCLIP 모델은 훈련 과정에서 발달적 경향을 보이며, 중간 체크포인트에서 성인 반응 패턴과의 유사성이 증가하지만, 모든 과제에서 일관되지는 않다.
- 모델는 인간보다 모호한 입력을 다룰 때 효과적이지 않아, 실용적 추론과 불확실성 처리 측면에서 핵심적인 차이점이 있음을 시사한다.
- 벤치마크는 현재 모델 간 인간 유사성의 상당한 다양성을 드러내며, 특히 모호성 해소와 발달 궤적 모델링이 향후 개선이 필요한 핵심 영역임을 강조한다.
- DevBench는 모델과 어린이 간에 방법론적으로 엄밀한 직접 비교를 가능하게 하며, 정확도 외에도 발달 가능성의 관점에서 모델을 평가할 수 있는 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.