Skip to main content
QUICK REVIEW

[논문 리뷰] DDP: Diffusion Model for Dense Visual Prediction

Yuanfeng Ji, Zhe Chen|arXiv (Cornell University)|2023. 03. 30.
Advanced Image and Video Retrieval Techniques인용 수 4
한 줄 요약

DDP는 영상 분할, 깊이 추정, BEV 맵 분할과 같은 조밀한 시각 예측 작업을 위한 단순하고 효율적인 확산 프레임워크를 제안한다. 이미지 특징에 의해 유도되는 조건부 노이즈 제거 확산 과정을 통해 노이즈에서 점진적으로 예측을 정제하는 경량 디코더를 적용함으로써, DDP는 6개의 벤치마크에서 최신 기술 수준 또는 경쟁력 있는 성능을 달성한다. 이는 Cityscapes에서 83.9 mIoU와 KITTI에서 0.05 REL을 기록하며, 동적 추론과 불확실성 인식 기능을 지원한다.

ABSTRACT

We propose a simple, efficient, yet powerful framework for dense visual predictions based on the conditional diffusion pipeline. Our approach follows a "noise-to-map" generative paradigm for prediction by progressively removing noise from a random Gaussian distribution, guided by the image. The method, called DDP, efficiently extends the denoising diffusion process into the modern perception pipeline. Without task-specific design and architecture customization, DDP is easy to generalize to most dense prediction tasks, e.g., semantic segmentation and depth estimation. In addition, DDP shows attractive properties such as dynamic inference and uncertainty awareness, in contrast to previous single-step discriminative methods. We show top results on three representative tasks with six diverse benchmarks, without tricks, DDP achieves state-of-the-art or competitive performance on each task compared to the specialist counterparts. For example, semantic segmentation (83.9 mIoU on Cityscapes), BEV map segmentation (70.6 mIoU on nuScenes), and depth estimation (0.05 REL on KITTI). We hope that our approach will serve as a solid baseline and facilitate future research

연구 동기 및 목표

  • 특수 작업용 아키텍처 설계 없이도 조밀한 시각 예측을 위한 일반 목적의 프레임워크를 개발하는 것.
  • 노이즈 제거 확산 모델을 높은 효율성과 강력한 일반화 능력을 갖춘 현대적 인식 파이프라인으로 확장하는 것.
  • 기존 단일 단계 판별 모델에서 부재한 동적 추론과 불확실성 인식 기능을 제공하는 것.
  • 아키텍처나 학습 기법의 특수 조작 없이 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • DDP는 이미지 특징에 의해 유도되는 조건부 확산 파이프라인을 활용하여, 가우시안 분포를 가진 잠재 맵에서 노이즈를 점진적으로 제거한다.
  • 학습 중에는 진짜 맵이 인코딩되고 노이즈 스케줄을 통해 손상되며, Swin Transformer와 같은 백본에서 추출한 이미지 특징과 융합된다.
  • 경량 맵 디코더는 이미지 조건부 특징을 사용하여 노이즈가 섞인 맵을 복원함으로써 깔끔한 예측을 생성한다.
  • 추론 시, 입력 이미지에 의해 유도되는 역확산 과정을 반복적으로 적용하여 무작위 노이즈 샘플을 점진적으로 정제함으로써 예측을 생성한다.
  • 이 프레임워크는 이미지 인코더(한 번만 실행)와 확산 디코더(반복적으로 실행)를 분리함으로써 효율적인 다단계 추론을 가능하게 한다.
  • 라벨 인코딩은 학습 가능한 스케일링 인자(최적은 0.01)를 가진 클래스 임베딩을 사용하며, 노이즈 스케줄은 더 나은 노이즈 제거 능력을 확보하기 위해 코사인으로 최적화된다.

실험 결과

연구 질문

  • RQ1특수 작업용 아키텍처 최적화 없이도 단순하고 통합된 확산 프레임워크가 조밀한 시각 예측에서 전용 판별 모델을 능가할 수 있는가?
  • RQ2노이즈 스케줄과 라벨 인코딩 전략의 선택이 조밀한 예측 작업 성능에 어떤 영향을 미치는가?
  • RQ3표준 단일 단계 모델과 달리, 확산 모델이 자연스럽게 동적 추론과 불확실성 추정을 지원할 수 있는가?
  • RQ4확산 기반 조밀한 예측 프레임워크에서 추론 속도와 정확도 사이의 상호 보완 관계는 어떠한가?

주요 결과

  • DDP는 ConvNeXt-L 백본을 사용하여 Cityscapes 영상 분할에서 83.9 mIoU를 달성하며, 전용 모델를 초월한다.
  • nuScenes BEV 맵 분할에서 DDP는 70.6 mIoU를 기록하여 BEVFusion 기준선(62.7 mIoU)을 크게 능가한다.
  • 깊이 추정 작업에서는 Swin-L 백본을 사용하여 KITTI에서 0.05 REL을 달성하며, 회귀 작업에서 뛰어난 성능을 보였다.
  • 단일 추출 단계만으로도 ADE20K에서 46.1 mIoU를 기록하여 UperNet과 K-Net을 능가하며, 세 단계로 증가시킬 경우 47.0 mIoU로 향상된다.
  • 모델는 동적 추론을 보이며, 추출 단계를 늘릴수록 정확도는 향상되지만 FLOPs와 FPS 비용은 중간 정도로 유지되어 효율성을 유지한다.
  • 절단 분석 결과, 코사인 노이즈 스케줄과 스케일링 인자 0.01를 가진 클래스 임베딩 전략이 최적의 성능을 내며, 6개 블록으로 구성된 디코더는 성능과 파rameter 효율성 사이의 균형을 잘 맞춘다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.