Skip to main content
QUICK REVIEW

[论文解读] AutoPose: Searching Multi-Scale Branch Aggregation for Pose Estimation

Xinyu Gong, Wuyang Chen|arXiv (Cornell University)|Aug 16, 2020
Human Pose and Action Recognition参考文献 47被引用 14
一句话总结

AutoPose 提出了一种新颖的神经架构搜索(NAS)框架,联合优化细胞级微结构、多尺度分支选择以及跨尺度特征融合,用于2D人体姿态估计。通过结合基于梯度的细胞架构搜索与基于强化学习的网络级分支和融合策略,AutoPose 发现了高性能的多分支、高分辨率架构,在 MS COCO 上达到 73.6 AP,优于现有 NAS 方法,在搜索空间灵活性与精度方面表现更优。

ABSTRACT

We present AutoPose, a novel neural architecture search(NAS) framework that is capable of automatically discovering multiple parallel branches of cross-scale connections towards accurate and high-resolution 2D human pose estimation. Recently, high-performance hand-crafted convolutional networks for pose estimation show growing demands on multi-scale fusion and high-resolution representations. However, current NAS works exhibit limited flexibility on scale searching, they dominantly adopt simplified search spaces of single-branch architectures. Such simplification limits the fusion of information at different scales and fails to maintain high-resolution representations. The presentedAutoPose framework is able to search for multi-branch scales and network depth, in addition to the cell-level microstructure. Motivated by the search space, a novel bi-level optimization method is presented, where the network-level architecture is searched via reinforcement learning, and the cell-level search is conducted by the gradient-based method. Within 2.5 GPU days, AutoPose is able to find very competitive architectures on the MS COCO dataset, that are also transferable to the MPII dataset. Our code is available at https://github.com/VITA-Group/AutoPose.

研究动机与目标

  • 为解决现有 NAS 方法在探索用于2D人体姿态估计的复杂、多分支、多尺度架构方面的局限性。
  • 实现高分辨率、跨尺度特征融合机制的自动发现,以保持精细的空间细节。
  • 克服结合细胞级、尺度级与网络级决策的庞大搜索空间所带来的可扩展性与优化挑战。
  • 设计一种双层优化策略,有效平衡不同层级架构搜索中的基于梯度与强化学习方法。
  • 在 MS COCO 与 MPII 数据集上验证所提搜索空间与优化策略的有效性,展示其可迁移性与最先进性能。

提出的方法

  • 提出一种分层多尺度搜索空间,同时探索细胞级微架构、尺度选择以及网络级分支与融合策略。
  • 采用双层优化机制:基于梯度的方法用于细胞级架构搜索,强化学习用于网络级决策(分支、尺度、融合)。
  • 设计新型融合单元,支持密集、结构化的跨尺度特征融合,而非简单的拼接或求和操作。
  • 使用带有共享权重的超网络,在搜索过程中高效评估候选架构,降低训练成本。
  • 通过保留多个不同尺度的并行分支,全程保持全分辨率表示。
  • 在全分辨率输入($256\times192$)下进行搜索,避免搜索与训练阶段之间的分布偏移,从而提升最终性能。

实验结果

研究问题

  • RQ1NAS 框架能否联合优化细胞级架构、多尺度分支选择以及跨尺度特征融合用于2D姿态估计?
  • RQ2与仅优化单路径或固定分支结构的方法相比,搜索多分支、多尺度架构的 NAS 方法性能如何?
  • RQ3在 NAS 搜索阶段使用全分辨率图像对密集预测任务(如姿态估计)的最终模型性能有何影响?
  • RQ4结合基于梯度与强化学习方法的双层优化策略,能否有效探索大规模、多层级的搜索空间?
  • RQ5所提出的融合单元与多分支设计相较于简单的拼接或单分支主干网络,对性能提升有何贡献?

主要发现

  • AutoPose 在 MS COCO 验证集上达到 73.6 AP,优于现有 NAS 方法,并在性能上超越了 HRNet-W32 等手工设计的先进模型。
  • 当每个阶段仅允许单一尺度时,性能急剧下降至 63.9 AP,证明多尺度并行分支的关键作用。
  • 若绕过所提出的融合单元而改用简单拼接操作,高 IOU 阈值下的性能显著下降(AP@75 从 80.1% 降至 77.6%),证实结构化跨尺度融合的重要性。
  • 手动固定所有四个分支(跨所有阶段)仅搜索细胞级架构,性能为 71.8 AP,低于 AutoPose 的 73.6 AP,表明联合进行网络级与细胞级搜索具有显著优势。
  • 在搜索阶段使用缩小的图像尺寸($128\times96$)导致 AP 下降 3.5%(70.1% vs. 73.6%),确认全分辨率搜索对密集预测任务至关重要。
  • 双层优化策略收敛稳定,细胞级与网络级决策的熵持续下降,同时验证 AP 与控制器奖励随时间逐步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。