[论文解读] Complex Event Recognition from Images with Few Training Examples
本文提出了一种基于网络的视觉概念发现框架,利用维基百科和Flickr标签从网络图像中学习具有判别性的、事件特定的视觉概念,通过预训练的CNN特征实现仅用一个训练样本对复杂社会事件进行分类。该方法在少样本事件识别任务中达到当前最优性能,在多个基准数据集(包括包含未见类别的罕见事件数据集)上优于直接微调CNN的方法。
We propose to leverage concept-level representations for complex event recognition in photographs given limited training examples. We introduce a novel framework to discover event concept attributes from the web and use that to extract semantic features from images and classify them into social event categories with few training examples. Discovered concepts include a variety of objects, scenes, actions and event sub-types, leading to a discriminative and compact representation for event images. Web images are obtained for each discovered event concept and we use (pretrained) CNN features to train concept classifiers. Extensive experiments on challenging event datasets demonstrate that our proposed method outperforms several baselines using deep CNN features directly in classifying images into events with limited training examples. We also demonstrate that our method achieves the best overall accuracy on a dataset with unseen event categories using a single training example.
研究动机与目标
- 解决在仅有少量标注样本的情况下识别图像中复杂社会事件和新闻事件的挑战。
- 开发一种可扩展的、基于网络的方法,用于发现相关视觉概念(物体、场景、动作、属性),而无需人工标注。
- 利用网络获取的概念构建紧凑且具有判别性的特征表示,使其能够泛化到未见的事件类别。
- 在罕见且多样的真实世界事件上评估该方法,这些事件因监督信息有限而使传统CNN难以处理。
提出的方法
- 使用维基百科定义事件类别,并提取相关关键词作为初始概念种子。
- 应用微博分段算法从噪声较大的Flickr标签中提取以事件为中心的短语。
- 将短语投影到word2vec嵌入空间,并检索最近邻以扩展概念池。
- 针对每个已发现的概念,通过Bing图像搜索获取网络图像,并从预训练网络中提取深度CNN特征。
- 使用网络图像及其CNN特征训练特定概念的分类器,为每个测试图像生成概念得分。
- 将所得的概念得分作为事件分类的高层级、紧凑表示。

实验结果
研究问题
- RQ1基于网络的视觉概念能否提升静态图像中复杂社会事件的少样本识别性能?
- RQ2基于概念的表示是否能泛化到概念发现过程中未见过的事件类别?
- RQ3与在有限训练数据上直接微调深度CNN相比,基于网络监督的概念学习表现如何?
- RQ4该方法能否在仅有一个训练样本的情况下,对罕见或此前未见的真实世界事件实现优异性能?
主要发现
- 在WIDER数据集上,该方法仅使用每类一个训练样本即达到82.09%的平均准确率,优于AlexNet-fc7(59.79%)和WEBLY-fc7(55.39%)。
- 在罕见事件数据集(RED)上,该方法在21个类别中的10个类别下,于少样本学习设置中优于基线方法,证明了其对未见类别的泛化能力。
- 即使在完整训练数据下,该方法在UIUC Sports数据集上达到96.68%的准确率,在WIDER数据集上达到78.59%,超过当前最优基线。
- 在低样本条件下,基于概念的表示比直接使用CNN特征更具判别性,适用于复杂事件识别。
- 该方法在多样化的真实世界事件(如“波士顿爆炸”和“尼泊尔地震”)上泛化良好,而传统模型因数据稀缺而失效。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。