Skip to main content
QUICK REVIEW

[论文解读] Multi-Modal Multi-Scale Deep Learning for Large-Scale Image Annotation

Yulei Niu, Zhiwu Lu|arXiv (Cornell University)|Sep 5, 2017
Advanced Image and Video Retrieval Techniques参考文献 40被引用 7
一句话总结

本文提出了一种用于大规模图像标注的多模态、多尺度深度学习框架,该框架联合学习多个网络深度的丰富视觉特征并有效融合,同时通过一种新颖的标签数量预测(LQP)头显式预测每张图像的最佳标签数量。该方法通过端到端训练和基于回归的显式标签数量估计,结合图像和噪声用户标签,在基准数据集上超越了最先进方法,实现了卓越的性能。

ABSTRACT

Image annotation aims to annotate a given image with a variable number of class labels corresponding to diverse visual concepts. In this paper, we address two main issues in large-scale image annotation: 1) how to learn a rich feature representation suitable for predicting a diverse set of visual concepts ranging from object, scene to abstract concept; 2) how to annotate an image with the optimal number of class labels. To address the first issue, we propose a novel multi-scale deep model for extracting rich and discriminative features capable of representing a wide range of visual concepts. Specifically, a novel two-branch deep neural network architecture is proposed which comprises a very deep main network branch and a companion feature fusion network branch designed for fusing the multi-scale features computed from the main branch. The deep model is also made multi-modal by taking noisy user-provided tags as model input to complement the image input. For tackling the second issue, we introduce a label quantity prediction auxiliary task to the main label prediction task to explicitly estimate the optimal label number for a given image. Extensive experiments are carried out on two large-scale image annotation benchmark datasets and the results show that our method significantly outperforms the state-of-the-art.

研究动机与目标

  • 为解决在大规模图像标注中学习适用于多样化视觉概念(从物体、场景到抽象属性)的丰富多尺度视觉表征的挑战。
  • 通过显式预测每张图像的最佳标签数量来解决标签数量可变的问题,而非依赖于固定的top-k选择。
  • 通过将用户提供的噪声标签作为模态与图像结合,提升特征表示,从而提高性能。
  • 通过引入基于回归的直接标签数量预测头,克服RNN模型通过人工标签排序隐式估计标签数量的局限性。

提出的方法

  • 提出一种双分支深度神经网络架构:一个非常深的主干网络分支用于特征提取,以及一个辅助特征融合分支,用于聚合主网络不同层的多尺度特征。
  • 从基于ResNet的主干网络的多个层级提取多尺度特征,并通过专用的特征融合网络进行融合,以增强不同抽象层级概念的表征能力。
  • 通过将用户提供的噪声标签作为文本输入模态引入,使模型具备多模态特性,将其嵌入后与视觉特征结合,以丰富表征。
  • 引入标签数量预测(LQP)头作为回归头,使用均方误差损失预测每张图像的相关标签数量,实现端到端优化。
  • 通过联合最小化多标签分类损失和LQP回归损失,对整个模型进行端到端训练,使分类任务与标签数量估计任务相互促进。
  • 该框架支持预训练和微调策略,其中视觉-文本表征模块先进行预训练,然后对所有参数进行微调。

实验结果

研究问题

  • RQ1多尺度深度学习架构能否有效捕捉从物体到抽象属性等多样化视觉概念的视觉特征,以实现大规模图像标注?
  • RQ2与固定top-k选择或隐式RNN序列生成相比,通过基于回归的头显式预测标签数量是否能提升性能?
  • RQ3在多模态学习框架中,将噪声用户提供的标签作为模态整合,对图像标注质量有何影响?
  • RQ4联合分类与标签数量预测目标的端到端训练策略,能否带来更优的特征表征和整体性能?
  • RQ5与基于分类的方法等替代策略相比,所提出的LQP方法是否更具有效性?

主要发现

  • 所提出的模型在NUS-WIDE和MS-COCO两个基准数据集上显著优于最先进方法,展现出在大规模图像标注任务中的卓越性能。
  • 使用均方误差回归的标签数量预测(LQP)头比基于分类的方法高出超过2%,表明回归更适合估计可变的标签数量。
  • 端到端训练策略同时提升了分类准确率和标签数量预测性能,表明两项任务在联合优化中相互受益。
  • 采用合适的概率阈值(如p=0.3)进行标签选择优于固定top-k选择,但LQP方法仍优于该阈值方法。
  • 定性结果表明,该模型生成的标注准确且语义一致,包括正确但非真实标注的语义有效标签。
  • 消融实验确认,多尺度特征融合、多模态输入和LQP头三个组件均对整体性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。