Skip to main content
QUICK REVIEW

[论文解读] DDP: Diffusion Model for Dense Visual Prediction

Yuanfeng Ji, Zhe Chen|arXiv (Cornell University)|Mar 30, 2023
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

DDP 提出了一种简单且高效的扩散框架,用于密集视觉预测任务,如语义分割、深度估计和鸟瞰图(BEV)地图分割。通过应用一种条件去噪扩散过程,该过程利用图像特征引导的轻量化解码器,从噪声中逐步优化预测结果,DDP 在六个基准测试中实现了最先进或具有竞争力的性能,包括在 Cityscapes 上达到 83.9 mIoU 和在 KITTI 上达到 0.05 REL 的指标,同时支持动态推理和不确定性感知。

ABSTRACT

We propose a simple, efficient, yet powerful framework for dense visual predictions based on the conditional diffusion pipeline. Our approach follows a "noise-to-map" generative paradigm for prediction by progressively removing noise from a random Gaussian distribution, guided by the image. The method, called DDP, efficiently extends the denoising diffusion process into the modern perception pipeline. Without task-specific design and architecture customization, DDP is easy to generalize to most dense prediction tasks, e.g., semantic segmentation and depth estimation. In addition, DDP shows attractive properties such as dynamic inference and uncertainty awareness, in contrast to previous single-step discriminative methods. We show top results on three representative tasks with six diverse benchmarks, without tricks, DDP achieves state-of-the-art or competitive performance on each task compared to the specialist counterparts. For example, semantic segmentation (83.9 mIoU on Cityscapes), BEV map segmentation (70.6 mIoU on nuScenes), and depth estimation (0.05 REL on KITTI). We hope that our approach will serve as a solid baseline and facilitate future research

研究动机与目标

  • 开发一种无需针对特定任务设计架构的通用密集视觉预测框架。
  • 将去噪扩散模型扩展至现代感知流水线,实现高效性与强泛化能力。
  • 实现动态推理与不确定性感知——这些特性在标准单步判别式模型中通常缺失。
  • 在无需架构或训练技巧优化的前提下,在多样化基准上实现最先进性能。

提出的方法

  • DDP 采用一种条件扩散流水线,通过图像特征引导,逐步从高斯分布的潜在图中去除噪声。
  • 在训练过程中,真实标签图被编码并根据噪声调度添加噪声,随后与来自主干网络(如 Swin Transformer)的图像特征融合。
  • 轻量级地图解码器利用图像条件特征学习去噪过程,生成干净的预测结果。
  • 在推理阶段,模型通过反向扩散过程逐步优化一个随机噪声样本,由输入图像引导生成预测。
  • 该框架将图像编码器(仅运行一次)与扩散解码器(迭代运行)解耦,实现高效的多步推理。
  • 标签编码采用类别嵌入,并引入可学习缩放因子(最优值为 0.01),噪声调度经过优化采用余弦形式以提升去噪能力。

实验结果

研究问题

  • RQ1一个简单且统一的扩散框架是否能在无需架构定制的情况下,超越针对特定任务设计的判别式模型在密集视觉预测中的表现?
  • RQ2噪声调度和标签编码策略的选择如何影响密集预测任务的性能?
  • RQ3扩散模型是否能天然支持动态推理与不确定性估计,而标准单步模型则不具备这一特性?
  • RQ4在基于扩散的密集预测框架中,推理速度与准确率之间的权衡关系如何?

主要发现

  • 在使用 ConvNeXt-L 主干网络的情况下,DDP 在 Cityscapes 语义分割任务中达到 83.9 mIoU,超越了专用模型。
  • 在 nuScenes BEV 地图分割任务中,DDP 达到 70.6 mIoU,显著优于 BEVFusion 基线模型(62.7 mIoU)。
  • 在深度估计任务中,DDP 使用 Swin-L 主干网络在 KITTI 上达到领先的 0.05 REL,展现出在回归任务中的强大性能。
  • 仅使用一步采样时,DDP 在 ADE20K 上达到 46.1 mIoU,优于 UperNet 和 K-Net;使用三步采样时进一步提升至 47.0 mIoU。
  • 该模型支持动态推理:增加采样步数可显著提升准确率,仅带来适度的 FLOPs 和 FPS 成本增加,保持高效性。
  • 消融实验表明,余弦噪声调度与缩放因子为 0.01 的类别嵌入策略可获得最优结果,且六层块解码器在性能与参数效率之间实现良好平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。