[论文解读] Towards In-context Scene Understanding
本文提出Hummingbird,一种视觉变换器模型,通过一种新颖的上下文预训练协议进行预训练,该协议利用最近邻(NN)检索增强特征表示,以支持上下文学习。通过利用跨图像注意力机制和空间注意力池化,Hummingbird在无需微调的情况下,在密集场景理解任务(如语义分割和深度估计)上实现了最先进(SOTA)的零样本性能,其表现接近任务特定微调模型的准确率,同时实现了快速、数据高效的新型任务适应能力。
In-context learning$\unicode{x2013}$the ability to configure a model's behavior with different prompts$\unicode{x2013}$has revolutionized the field of natural language processing, alleviating the need for task-specific models and paving the way for generalist models capable of assisting with any query. Computer vision, in contrast, has largely stayed in the former regime: specialized decoders and finetuning protocols are generally required to perform dense tasks such as semantic segmentation and depth estimation. In this work we explore a simple mechanism for in-context learning of such scene understanding tasks: nearest neighbor retrieval from a prompt of annotated features. We propose a new pretraining protocol$\unicode{x2013}$leveraging attention within and across images$\unicode{x2013}$which yields representations particularly useful in this regime. The resulting Hummingbird model, suitably prompted, performs various scene understanding tasks without modification while approaching the performance of specialists that have been finetuned for each task. Moreover, Hummingbird can be configured to perform new tasks much more efficiently than finetuned models, raising the possibility of scene understanding in the interactive assistant regime.
研究动机与目标
- 为密集计算机视觉任务(如语义分割和深度估计)实现上下文学习,这些任务传统上需要任务特定的微调。
- 开发一种预训练协议,生成适用于非参数化检索的表示,从而实现在无需参数更新情况下的快速适应。
- 探究自监督视觉模型是否仅通过基于提示的检索即可在密集场景理解任务上实现强大的零样本性能。
- 比较不同预训练目标和架构组件在支持基于检索的场景理解方面的有效性。
- 证明单一通用模型可通过提示工程高效适应新视觉任务,从而减少对昂贵微调的依赖。
提出的方法
- 提出一种名为上下文预训练的新预训练协议,通过使用其他图像的特征记忆库来更新每张图像的空间特征,实现跨图像注意力机制。
- 引入空间注意力池化,将上下文化的特征网格汇总为单个图像级表示,提升下游检索任务的表示质量。
- 采用基于检索监督的对比自监督目标,模型学习从标注示例的记忆库中检索正确特征。
- 采用双记忆机制:预训练记忆库用于自监督过程中的特征检索,评估记忆库用于推理阶段的最近邻搜索。
- 在推理阶段使用编码器的特征进行最近邻检索,实现无需任何模型更新的零样本适应。
- 在ImageNet-22k上使用ViT-B和ViT-L编码器训练模型,并对记忆库大小、采样策略和预训练目标进行消融实验。

实验结果
研究问题
- RQ1视觉变换器能否被预训练以支持语义分割和深度估计等密集场景理解任务的上下文学习?
- RQ2与标准自监督预训练相比,采用跨图像注意力机制的上下文预训练在零样本检索性能方面有何提升?
- RQ3空间注意力池化与全局池化或[CLS]标记相比,在基于检索的场景理解中影响如何?
- RQ4在预训练期间采用基于检索的监督在多大程度上提升了对下游任务的泛化能力?
- RQ5在准确率、数据效率和适应速度方面,基于检索的推理性能与微调模型相比如何?
主要发现
- 仅通过最近邻检索,Hummingbird在PASCAL VOC语义分割任务上达到70.5%的mIoU,在ADE20K上达到30.7%的mIoU,接近完全微调模型的性能。
- 在使用ViT-L和ImageNet-22k预训练时,Hummingbird在PASCAL VOC上达到84.1%的mIoU,在ADE20K上达到50.8%的mIoU,展现出强大的零样本泛化能力。
- 同时采用自监督和基于检索目标训练的模型(Hummingbird++)在ADE20K上达到76.2%的mIoU,优于仅采用自监督或仅采用检索监督的基线模型。
- 最近邻检索在不同运行之间的变异性仅为微调的1/10,且无需超参数调优,因此是一种可靠且高效的在线评估代理。
- 更大的预训练和评估记忆库(例如153,600个特征)显著提升了性能,尤其在ADE20K等大规模数据集上表现更优。
- 所提出的上下文预训练和空间注意力池化方法生成的表示,相较于MAE或DINO等标准自监督方法,显著提升了检索效率。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。