[论文解读] Learning what and where to attend
本文提出了ClickMe,一个通过游戏化在线实验收集的大规模人类注意力图数据集,旨在为训练深度卷积网络(DCNs)提供更强的监督信号。通过与ClickMe数据联合训练一种新型全局-局部注意力(GALA)模块,作者显著提升了分类准确率,并生成了比标准模型或显著性监督模型更具可解释性、更符合人类视觉策略的视觉特征。
Most recent gains in visual recognition have originated from the inclusion of attention mechanisms in deep convolutional networks (DCNs). Because these networks are optimized for object recognition, they learn where to attend using only a weak form of supervision derived from image class labels. Here, we demonstrate the benefit of using stronger supervisory signals by teaching DCNs to attend to image regions that humans deem important for object recognition. We first describe a large-scale online experiment (ClickMe) used to supplement ImageNet with nearly half a million human-derived "top-down" attention maps. Using human psychophysics, we confirm that the identified top-down features from ClickMe are more diagnostic than "bottom-up" saliency features for rapid image categorization. As a proof of concept, we extend a state-of-the-art attention network and demonstrate that adding ClickMe supervision significantly improves its accuracy and yields visual features that are more interpretable and more similar to those used by human observers.
研究动机与目标
- 为解决视觉识别中弱监督的局限性,通过引入显式的人类注意力信号。
- 开发一种可扩展的方法,在ImageNet规模下收集高质量的人类衍生注意力图。
- 通过与人类视觉策略对齐,提升深度网络中注意力机制的可解释性与性能。
- 探究人类监督的注意力是否能生成更类人、更有效的视觉表征。
提出的方法
- 使用游戏化在线平台(ClickMe)收集了近五十万张ImageNet图像上的人类标注注意力图,玩家需选择用于物体识别的诊断图像区域。
- 在训练过程中,将ClickMe数据集用作辅助监督信号,与主图像分类任务联合训练全局-局部注意力(GALA)模块。
- GALA模块结合空间注意力与通道注意力,学习根据人类识别的诊断区域调制特征图。
- 该方法在挤压-激励(SE)模块基础上引入双路径机制,可同时关注空间位置与特征通道。
- 采用随机化检验验证ClickMe监督的注意力图在快速分类任务中比自底向上的显著性图更具诊断性。
- 在ImageNet与COCO数据集上,通过Top-1/Top-5准确率以及与真实分割掩码的交并比(IOU)评估模型性能。
实验结果
研究问题
- RQ1人类衍生的注意力图能否作为比仅使用类别标签更强的监督信号,用于训练深度卷积网络?
- RQ2与人类注意力图联合训练是否能生成更可解释、更符合人类视觉策略的视觉特征?
- RQ3ClickMe监督的注意力图与自底向上的显著性图相比,在支持快速图像分类方面表现如何?
- RQ4在先进注意力模块中引入人类注意力,能在多大程度上提升分类准确率与表征质量?
主要发现
- 在约30万张样本的缩减数据集上训练时,ClickMe监督模型的Top-5错误率相比标准ResNet-50与SE-ResNet-50降低了约25%。
- 当仅可见图像中6%的像素(按ClickMe注意力图掩码)时,参与者即可达到分类准确率的天花板;而使用自底向上的显著性图则需完整图像才能达到类似性能。
- 使用ClickMe监督训练的GALA-ResNet-50模型生成的注意力图与COCO实例分割掩码的IOU达到0.26,显著高于未使用ClickMe的版本(IOU为0.03,p < 0.001)。
- ClickMe数据集在快速分类任务中表现出更优的诊断性,证实人类识别的特征比自底向上的显著性特征更具信息量。
- 使用ClickMe监督的GALA模块生成的视觉特征,在定性与定量层面均更接近人类观察者所使用的特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。