Skip to main content
QUICK REVIEW

[论文解读] Quantized Densely Connected U-Nets for Efficient Landmark Localization

Zhiqiang Tang, Xi Peng|arXiv (Cornell University)|Aug 7, 2018
Face recognition and analysis参考文献 39被引用 12
一句话总结

本文提出了一种量化密集连接的U-Net(DU-Net),通过语义级别的密集连接在堆叠的U-Net之间实现全局特征重用,从而实现高效的视觉关键点定位。通过采用高阶连接、内存高效的训练、迭代优化以及低比特宽度的权重、输入和梯度端到端量化,该方法在参数量减少约70%、模型大小缩小约98%、训练内存消耗降低约75%的情况下,实现了最先进(SOTA)的精度表现。

ABSTRACT

In this paper, we propose quantized densely connected U-Nets for efficient visual landmark localization. The idea is that features of the same semantic meanings are globally reused across the stacked U-Nets. This dense connectivity largely improves the information flow, yielding improved localization accuracy. However, a vanilla dense design would suffer from critical efficiency issue in both training and testing. To solve this problem, we first propose order-K dense connectivity to trim off long-distance shortcuts; then, we use a memory-efficient implementation to significantly boost the training efficiency and investigate an iterative refinement that may slice the model size in half. Finally, to reduce the memory consumption and high precision operations both in training and testing, we further quantize weights, inputs, and gradients of our localization network to low bit-width numbers. We validate our approach in two tasks: human pose estimation and face alignment. The results show that our approach achieves state-of-the-art localization accuracy, but using ~70% fewer parameters, ~98% less model size and saving ~75% training memory compared with other benchmark localizers. The code is available at https://github.com/zhiqiangdon/CU-Net.

研究动机与目标

  • 解决堆叠U-Net架构在关键点定位任务中信息流受限和参数冗余的问题。
  • 通过在相同分辨率的模块之间建立全局语义级连接,提升堆叠U-Net之间的特征重用能力。
  • 通过参数高效的架构设计与量化技术,在不损失精度的前提下减少模型大小和训练内存消耗。
  • 通过将权重、输入和梯度量化至低比特宽度,实现在移动设备上的高效训练与部署。
  • 探究迭代优化方法是否可将模型大小减半,同时保持性能。

提出的方法

  • 提出高阶(order-K)密集连接机制,仅保留最近的K个U-Net的连接,将参数增长从二次方级降低至线性级。
  • 通过在所有连接模块间复用预分配的内存,实现内存高效的训练策略,支持更深的DU-Net训练。
  • 引入一种迭代优化机制:首次DU-Net推理输出作为第二次推理的输入,并施加监督,从而将模型大小减半。
  • 将模型权重、中间特征输入和梯度量化至低比特宽度(如8位或二值化),以降低内存与计算开销。
  • 在BW-α变体中引入缩放因子与权重二值化,进一步压缩模型,同时保持精度。
  • 在人体姿态估计与人脸对齐基准上进行训练与评估,与最先进方法进行对比。

实验结果

研究问题

  • RQ1与标准堆叠U-Net相比,堆叠U-Net中实现全局特征重用是否能提升关键点定位精度?
  • RQ2高阶连接是否能在深层U-Net架构中有效平衡模型精度与参数效率?
  • RQ3内存高效的实现是否能支持高连接度下的深层DU-Net模型训练?
  • RQ4迭代优化方法是否可将模型大小减半,同时保持竞争力的性能?
  • RQ5端到端量化权重、输入和梯度是否能显著降低训练内存消耗,且不造成显著精度损失?

主要发现

  • 所提出的DU-Net在人体姿态估计与人脸对齐基准上均实现了最先进(SOTA)的关键点定位精度。
  • DU-Net-BW-α (16) 在300-W数据集上的性能与SOTA方法[23]相当,但模型大小缩小约50倍。
  • 与最先进局部定位器相比,该模型参数量减少约70%,模型大小减少约98%,同时训练内存消耗降低约75%。
  • 高阶连接将参数增长从O(n²)降低至O(n),显著提升了效率。
  • 对权重、输入和梯度的量化使训练内存消耗降低约75%,且性能下降可忽略。
  • 迭代优化方法成功将模型大小减半,同时保持高精度,LSP与300-W评估结果均验证了这一点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。