[论文解读] Learning high-level visual representations from a child's perspective without strong inductive biases
本文研究了是否能够从儿童的自我中心视觉经验中学习到高层次视觉表征,而无需强归纳偏置。通过在单个儿童的200小时头戴式摄像机视频上进行自监督学习,作者训练视觉变换器模型,以学习到稳健的语义理解与生成能力——尽管训练数据与ImageNet大相径庭,这些模型在下游任务中的表现仍达到了ImageNet预训练模型的70%。
Young children develop sophisticated internal models of the world based on their visual experience. Can such models be learned from a child's visual experience without strong inductive biases? To investigate this, we train state-of-the-art neural networks on a realistic proxy of a child's visual experience without any explicit supervision or domain-specific inductive biases. Specifically, we train both embedding models and generative models on 200 hours of headcam video from a single child collected over two years and comprehensively evaluate their performance in downstream tasks using various reference models as yardsticks. On average, the best embedding models perform at a respectable 70% of a high-performance ImageNet-trained model, despite substantial differences in training data. They also learn broad semantic categories and object localization capabilities without explicit supervision, but they are less object-centric than models trained on all of ImageNet. Generative models trained with the same data successfully extrapolate simple properties of partially masked objects, like their rough outline, texture, color, or orientation, but struggle with finer object details. We replicate our experiments with two other children and find remarkably consistent results. Broadly useful high-level visual representations are thus robustly learnable from a representative sample of a child's visual experience without strong inductive biases.
研究动机与目标
- 研究是否能够从儿童的真实世界视觉经验中学习到高层次视觉表征,而无需强归纳偏置。
- 评估在单个儿童的纵向自我中心视频数据上训练的自监督学习模型的能力。
- 评估此类模型在分类、分割和生成等下游任务中的泛化能力,与标准预训练模型进行比较。
- 探讨这些表征在多个儿童和模型架构之间的鲁棒性与一致性。
- 通过使用早期视觉经验的真实代理,弥合儿童发展与深度学习之间的数据鸿沟。
提出的方法
- 使用三种自监督学习(SSL)算法(DINO、Mugs 和掩码自编码器(MAE))训练视觉变换器(ViT)模型。
- 使用一个纵向的自我中心视频数据集(SAYCam),总计约200小时的连续头戴式摄像机录像,来自一名儿童。
- 通过在9项下游任务(分类与分割)上微调并冻结特征,评估嵌入模型。
- 在从学习得到的码本中提取的离散潜在码上训练基于自回归变换器的生成模型,以实现图像补全与生成。
- 在训练期间应用标准的SSL数据增强方法(如颜色抖动、随机裁剪),以提升泛化能力。
- 在另外两名儿童上重复实验,以评估所学表征的一致性与鲁棒性。
实验结果
研究问题
- RQ1是否能够从儿童的自我中心视觉经验中学习到高层次视觉表征,而无需强归纳偏置?
- RQ2在儿童类视觉数据上训练的模型与ImageNet预训练模型相比,在下游视觉识别任务中的表现如何?
- RQ3此类模型在无显式监督的情况下,能在多大程度上学习到广泛的语义类别和物体定位能力?
- RQ4在儿童视觉数据上训练的生成模型能否外推部分物体属性,如形状、颜色或方向?
- RQ5所学表征在不同儿童和训练运行之间的一致性如何?
主要发现
- 最佳嵌入模型在下游分类与分割任务中,平均达到了高性能ImageNet训练模型70%的性能。
- 模型在无显式监督的情况下学习到了广泛的语义类别和基本的物体定位能力,但其物体中心性不及ImageNet训练的模型。
- 生成模型能够成功从部分掩码中外推出粗粒度的物体属性,如大致轮廓、纹理、颜色和方向,但在细粒度细节上表现不佳。
- 在三名不同儿童上的结果表现出显著的一致性,表明所学表征对视觉经验的个体差异具有鲁棒性。
- 尽管数据量有限(约40天的视觉输入)且图像质量较低,模型仍展现出有意义的视觉理解能力,表明仅靠丰富、连续的视觉经验即可支持高层次表征学习。
- 本研究证明,仅使用通用深度学习架构和自监督学习,无需领域特定的归纳偏置,即可从儿童的真实世界视觉经验中学习到强大的视觉表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。