Skip to main content
QUICK REVIEW

[论文解读] SwiDeN : Convolutional Neural Networks For Depiction Invariant Object Recognition

Ravi Kiran Sarvadevabhatla, Shiv Surya|arXiv (Cornell University)|Jul 29, 2016
Advanced Neural Network Applications参考文献 15被引用 4
一句话总结

SwiDeN 是一种新颖的卷积神经网络架构,通过在照片和艺术绘图之间采用深层、动态的风格特定子网络切换机制,实现了描绘风格无关的对象识别。它在 Photo-Art-50 数据集上取得了 94.42% 的总体准确率,显著优于基线方法和领域自适应方法,尤其在非照片类的 'Art' 描绘上达到了 91.12% 的准确率,展示了在跨描绘风格识别任务中的最先进性能。

ABSTRACT

Current state of the art object recognition architectures achieve impressive performance but are typically specialized for a single depictive style (e.g. photos only, sketches only). In this paper, we present SwiDeN : our Convolutional Neural Network (CNN) architecture which recognizes objects regardless of how they are visually depicted (line drawing, realistic shaded drawing, photograph etc.). In SwiDeN, we utilize a novel `deep' depictive style-based switching mechanism which appropriately addresses the depiction-specific and depiction-invariant aspects of the problem. We compare SwiDeN with alternative architectures and prior work on a 50-category Photo-Art dataset containing objects depicted in multiple styles. Experimental results show that SwiDeN outperforms other approaches for the depiction-invariant object recognition problem.

研究动机与目标

  • 为解决当前模型在不同描绘风格(如照片、素描、绘图)之间进行对象识别时的挑战,因为现有模型通常仅针对单一风格进行优化。
  • 通过使单一模型能够跨风格泛化,缩小人类水平的描绘风格无关识别能力与机器性能之间的差距。
  • 设计一种端到端的深度学习框架,联合学习描绘特定特征与描绘无关特征,而无需依赖手工设计模块或复杂领域自适应技术。
  • 通过引入可学习的、动态的切换机制,克服迁移学习和领域自适应的局限性,将输入路由至合适的风格特定子网络。

提出的方法

  • SwiDeN 采用双分支架构,包含一个共享主干网络和两个并行的子网络:一个针对照片描绘进行优化,另一个针对艺术/插图描绘进行优化。
  • 一个‘深层’描绘风格分类器(即‘开关’)根据输入图像的视觉风格,动态地将其路由到合适的子网络,从而实现风格特定的特征学习。
  • 该开关机制与网络其余部分端到端联合训练,使系统能够基于视觉线索学习何时以及如何进行输入路由。
  • 该架构以 VGG-19 作为基础网络,每个子网络使用独立的学习率——‘Art’ 子网络的学习率设置为四倍,以补偿其对照片的预训练偏差。
  • 最终预测通过在风格特定处理后融合共享层的特征,再经由 Softmax 分类器生成。
  • 模型通过数据增强(RGB 通道抖动、水平翻转、对 'Art' 图像进行形态学操作)进行训练,并在测试时采用五裁剪平均策略进行评估。

实验结果

研究问题

  • RQ1单一深度神经网络是否能在不针对某一特定风格进行专门化的情况下,实现对多种描绘风格(如照片、素描、绘图)的高精度识别?
  • RQ2在跨描绘风格识别任务中,风格特定子网络之间的动态可学习切换机制,与标准微调或领域自适应方法相比表现如何?
  • RQ3当通过切换机制结合风格特定特征学习时,共享表征在学习描绘无关特征方面的有效程度如何?
  • RQ4风格特定子网络的深度是否会影响模型在不同风格之间泛化的能力,尤其是在非照片类描绘中?

主要发现

  • SwiDeN 在 Photo-Art-50 数据集上实现了 94.42% 的总体分类准确率,优于基线模型(93.80%)和梯度反转网络(GRN,92.64%)架构。
  • 该模型在 'Art' 描绘上的准确率达到 91.12%,显著高于基线模型(89.80%)和 GRN(88.52%),证明其在非照片类风格中的有效性。
  • SwiDeN 的 C4-S 变体在所有 SwiDeN 架构中表现最佳,达到 94.42% 的总体准确率,表明风格特定子网络的深度达到最优。
  • SwiDeN 在性能上优于 Wu 等人 [16] 提出的多属性部件图模型,总体准确率达到 93.02%,高于其 89.67%,即使在类别不平衡的划分下依然表现更优。
  • SwiDeN 中 'Photo' 与 'Art' 准确率之间的差距最小化(97.72% vs. 91.12%),优于基线模型(97.80% vs. 89.80%),显示出更好的性能平衡性。
  • 结果表明,动态切换机制在学习风格特定特征方面比 GRN 等间接反馈机制更有效,尽管两者设计原则相似,但 GRN 表现较差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。