Skip to main content
QUICK REVIEW

[论文解读] Fully-adaptive Feature Sharing in Multi-Task Networks with Applications in Person Attribute Classification

Yongxi Lu, Abhishek Kumar|arXiv (Cornell University)|Nov 16, 2016
Video Surveillance and Tracking Methods参考文献 43被引用 9
一句话总结

本文提出了一种完全自适应的动态多任务学习框架,通过在训练过程中贪婪地扩展一个纤薄网络,自动设计出紧凑的深度神经网络架构,采用一种新颖的标准对相似任务进行分组并最小化复杂度。该方法在行人属性分类任务上实现了最先进(SOTA)的准确率——在CelebA数据集上实现了90%的面部属性准确率,模型大小仅为VGG-16的1/90,推理速度提升3倍,同时实现了高效且紧凑的联合面部与服饰属性预测。

ABSTRACT

Multi-task learning aims to improve generalization performance of multiple prediction tasks by appropriately sharing relevant information across them. In the context of deep neural networks, this idea is often realized by hand-designed network architectures with layers that are shared across tasks and branches that encode task-specific features. However, the space of possible multi-task deep architectures is combinatorially large and often the final architecture is arrived at by manual exploration of this space subject to designer's bias, which can be both error-prone and tedious. In this work, we propose a principled approach for designing compact multi-task deep learning architectures. Our approach starts with a thin network and dynamically widens it in a greedy manner during training using a novel criterion that promotes grouping of similar tasks together. Our Extensive evaluation on person attributes classification tasks involving facial and clothing attributes suggests that the models produced by the proposed method are fast, compact and can closely match or exceed the state-of-the-art accuracy from strong baselines by much more expensive models.

研究动机与目标

  • 自动化多任务深度神经网络架构的设计,消除对组合爆炸式架构空间的手动、有偏见的探索。
  • 通过动态确定每一层网络中哪些任务应共享特征,实现选择性、与任务相关的特征共享。
  • 在保持或超越最先进准确率的同时,生成紧凑、低延迟的模型,且内存占用极低。
  • 开发一种有原则的、贪婪的、自顶向下的网络扩展策略,以平衡任务相关性与模型复杂度。

提出的方法

  • 该方法从一个纤薄网络开始,在训练过程中使用一种新颖的分支准则动态扩展网络宽度,该准则促进相似任务的分组并惩罚模型复杂度。
  • 一种贪婪的、逐层的分支机制基于任务相似性和复杂度成本,决定在每一层中某个任务应与哪些任务共享特征。
  • 提出一种基于联合正交匹配追踪(SOMP)的新型初始化方法,将来自更宽预训练网络(如VGG-16)的知识迁移至纤薄网络中,从而加速收敛并提升准确率。
  • 该方法采用多轮分支过程,仅在准则表明性能提升且冗余减少时,才通过增加新分支来逐步扩展网络。
  • 通过在分支决策过程中引入复杂度惩罚,避免不相关任务之间的负迁移。
  • 网络架构采用端到端训练,共享底层卷积层,并动态生成任务特定的分支,从而实现非互斥属性的联合预测。

实验结果

研究问题

  • RQ1一种完全自适应的、动态的架构搜索过程是否能够自动学习到最优的多任务网络结构,而无需人工设计或对任务关系做出先验假设?
  • RQ2基于相似性和复杂度的动态、逐层任务分组,如何影响多任务行人属性分类中模型的准确率与紧凑性?
  • RQ3基于SOMP的初始化方法从预训练的宽网络中迁移知识,在纤薄多任务模型中在多大程度上提升了收敛速度与性能?
  • RQ4一个单一的紧凑多任务模型是否能够联合预测多样化的面部与服饰属性,且性能达到或超过远为庞大的基线模型?
  • RQ5任务分组对模型准确率有何影响?在不同属性类别中,对相似任务进行分组是否能持续提升性能?

主要发现

  • 所提方法在CelebA数据集的面部属性分类任务上实现了90%的准确率,与远为庞大的VGG-16模型达到的最先进结果相当,但模型大小仅为后者的1/90,推理速度提升3倍。
  • 在DeepFashion数据集上,该方法通过单一紧凑的多任务模型实现了面部与服饰属性的联合预测,同时保持了高准确率。
  • SOMP初始化方法显著提升了训练收敛速度与最终准确率,实验表明其训练进度比随机初始化更快且更优。
  • 消融实验表明,对相似任务进行分组可提升大多数属性的准确率,尤其在对过宽分支中的任务重新分组时,性能增益最为显著。
  • 紧凑模型Branch-32-2.0与VGG-16基线之间的准确率差距主要源于模型容量较小,而非预训练权重使用不当,这一结论通过预训练使用情况的消融实验得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。