[论文解读] Anytime Dense Prediction with Confidence Adaptivity
本论文提出 ADP-C,这是首个端到端的任意时间密集预测框架,可实现语义分割和人体姿态估计任务中的渐进式、置信度自适应推理。通过重新设计带有编码器-解码器头的早期退出机制,并基于预测置信度实施空间自适应计算,ADP-C 在 Cityscapes 和 MPII 上分别将总 FLOPs 减少 44.4% 和 59.1%,同时保持与基础模型相同的最终精度。
Anytime inference requires a model to make a progression of predictions which might be halted at any time. Prior research on anytime visual recognition has mostly focused on image classification. We propose the first unified and end-to-end approach for anytime dense prediction. A cascade of "exits" is attached to the model to make multiple predictions. We redesign the exits to account for the depth and spatial resolution of the features for each exit. To reduce total computation, and make full use of prior predictions, we develop a novel spatially adaptive approach to avoid further computation on regions where early predictions are already sufficiently confident. Our full method, named anytime dense prediction with confidence (ADP-C), achieves the same level of final accuracy as the base model, and meanwhile significantly reduces total computation. We evaluate our method on Cityscapes semantic segmentation and MPII human pose estimation: ADP-C enables anytime inference without sacrificing accuracy while also reducing the total FLOPs of its base models by 44.4% and 59.1%. We compare with anytime inference by deep equilibrium networks and feature-based stochastic sampling, showing that ADP-C dominates both across the accuracy-computation curve. Our code is available at https://github.com/liuzhuang13/anytime .
研究动机与目标
- 实现密集预测任务中的任意时间推理,使预测可在任意时间点中止,且质量逐步提升。
- 在不牺牲最终精度的前提下,降低密集预测模型的计算成本,尤其适用于实时或低资源环境下的部署。
- 设计一个统一的、端到端可训练的框架,支持多个预测阶段和空间自适应计算。
- 开发一种基于置信度的掩码机制,避免在空间和层级上对已具有高置信度的预测进行冗余计算。
提出的方法
- 引入一系列带有编码器-解码器头的早期退出机制,以处理各阶段间特征深度和空间分辨率的差异。
- 重新设计退出头结构,确保足够的感受野和空间平滑性,从而提升早期预测的质量。
- 通过掩码高置信度预测的像素实现空间自适应推理,保留其输出结果,并跳过后续层的卷积计算。
- 使用类别预测的最大概率作为置信度度量,以确定哪些像素应被掩码并跳过进一步计算。
- 对被掩码的像素采用插值方式处理特征,而非卷积操作,从而在保持预测一致性的同时降低 FLOPs。
- 端到端联合训练整个模型,包括所有退出头和基于置信度的掩码机制,以协同优化精度与效率。
实验结果
研究问题
- RQ1是否能够设计一个统一的、端到端的深度学习框架,支持具有渐进精度提升的任意时间密集预测?
- RQ2如何利用密集预测中的空间结构来减少计算量而不造成精度损失?
- RQ3何种置信度度量能够实现密集预测任务中有效且高效的自适应空间计算?
- RQ4与均匀或随机掩码相比,置信度自适应计算在精度和 FLOP 减少方面表现如何?
- RQ5所提出方法是否能在多种密集预测基准上实现显著的 FLOP 减少,同时保持最终模型的精度?
主要发现
- 与基础 HRNet-W18 模型相比,ADP-C 在 Cityscapes 语义分割任务中将总 FLOPs 减少 44.4%,在 MPII 人体姿态估计任务中减少 59.1%。
- ADP-C 的最终预测结果达到了与基础模型相同的 mIoU,证明在计算量减少的情况下未造成精度下降。
- 基于最大概率的置信度掩码优于固定比例和随机掩码,基于熵的置信度方法表现相似但效率较低。
- 消融实验证实,采用编码器-解码器结构重新设计的退出头显著提升了早期预测质量,并优化了精度-计算量的权衡。
- 可视化结果表明,高置信度区域(如道路、天空)被早期掩码,而复杂区域(如行人、遮挡的肢体)则被更深层次处理,符合直观的计算资源分配逻辑。
- 在两个基准测试中,ADP-C 在整个精度-计算量曲线范围内均优于深度平衡网络和基于特征的随机采样方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。