Skip to main content
QUICK REVIEW

[논문 리뷰] DAG: Depth-Aware Guidance with Denoising Diffusion Probabilistic Models

Gyeongnyeon Kim, Woo-Seok Jang|arXiv (Cornell University)|2022. 12. 17.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 사전 훈련된 확산 모델의 내부 표현을 활용하여 허위 레이블링과 깊이 사전 지식 가이던스를 통합함으로써 확산 모델의 깊이 인식 생성 능력을 향상시키는 새로운 방법인 Depth-Aware Guidance (DAG)를 제안한다. 레이블 효율적인 깊이 추정과 두 가지 새로운 가이던스 전략을 활용함으로써 DAG는 생성된 이미지의 기하학적 타당성을 크게 향상시키며, LSUN-Church에서 17.31 dFID 점수를 기록하여 깊이 인식 이미지 생성 분야에서 최고 성능을 달성한다.

ABSTRACT

Generative models have recently undergone significant advancement due to the diffusion models. The success of these models can be often attributed to their use of guidance techniques, such as classifier or classifier-free guidance, which provide effective mechanisms to trade-off between fidelity and diversity. However, these methods are not capable of guiding a generated image to be aware of its geometric configuration, e.g., depth, which hinders their application to areas that require a certain level of depth awareness. To address this limitation, we propose a novel guidance method for diffusion models that uses estimated depth information derived from the rich intermediate representations of diffusion models. We first present label-efficient depth estimation framework using internal representations of diffusion models. Subsequently, we propose the incorporation of two guidance techniques based on pseudo-labeling and depth-domain diffusion prior during the sampling phase to self-condition the generated image using the estimated depth map. Experiments and comprehensive ablation studies demonstrate the effectiveness of our method in guiding the diffusion models towards the generation of geometrically plausible images.

연구 동기 및 목표

  • 확산 모델에서 기하학적 인식이 부족해 깊이가 비현실적이거나 레이아웃이 혼잡한 이미지를 생성하는 문제를 해결하기 위해.
  • 사전 훈련된 확산 모델의 내부 표현을 활용한 레이블 효율적인 깊이 추정 프레임워크를 개발하기 위해.
  • 샘플링 단계 동안 깊이 인식을 통합하는 두 가지 새로운 가이던스 전략—깊이 일관성 및 깊이 사전 지식 가이던스—를 제안하기 위해.
  • 기하학적 탈진성의 정도를 더 잘 측정하기 위해 깊이 추정 네트워크를 기반으로 한 새로운 평가 지표를 도입하기 위해.
  • DAG가 생성한 이미지가 단일 레이어 깊이 추정 모델을 훈련시키는 데 효과적인 데이터로 활용될 수 있음을 입증하기 위해.

제안 방법

  • 사전 훈련된 확산 모델의 풍부한 중간 특징을 활용하여, 진정한 깊이 레이블이 필요 없이 레이블 효율적인 깊이 예측기 학습을 수행한다.
  • 일관성 정규화를 통한 허위 레이블링 적용: 더 나은 예측을 허위 레이블로 간주하여 나쁜 예측을 개선하도록 모델을 안내한다.
  • 별도의 사전 훈련된 확산 U-Net을 사전 지식 네트워크로 사용하여 샘플링 중에 깊이 정보를 주입함으로써 깊이 사전 지식 가이던스를 도입한다.
  • 깊이 추정을 위한 U-Net 기반 백본을 사용하며, DAG를 통해 생성된 합성 데이터로 미세조정하여 단일 레이어 깊이 예측 성능을 향상시킨다.
  • 깊이 사전 지식 가이던스 동안 생성된 깊이 맵을 사전 지식 네트워크의 해상도와 일치시키기 위해 다중 해상도 깊이 맵 보간 전략을 사용한다.
  • 사전 훈련된 깊이 추정 네트워크를 사용하여 생성된 이미지의 깊이 타당성을 측정하는 dFID라는 새로운 평가 지표를 제안한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 확산 모델의 내부 표현을 효과적으로 활용하여 레이블 효율적인 깊이 추정을 수행할 수 있는가?
  • RQ2일관성 정규화와 깊이 사전 지식 가이던스가 함께 작용하여 확산 기반 이미지 생성의 기하학적 타당성을 향상시킬 수 있는가?
  • RQ3제안된 DAG 프레임워크가 복잡한 3D 환경에서 깊이 인식 이미지를 생성하는 데 기존 기준 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ4DAG가 생성한 이미지가 단일 레이어 깊이 추정 모델의 성능 향상에 효과적인 고품질 합성 데이터로 활용될 수 있는가?
  • RQ5가이던스 스케일과 사전 지식 네트워크 해상도의 선택이 깊이 인식 이미지 생성 품질에 어떤 영향을 미치는가?

주요 결과

  • 제안된 DAG 프레임워크는 LSUN-Church 데이터셋에서 dFID 점수 17.31을 기록하여 기준 모델(17.69)과 아블레이션 변형보다 뛰어난 성능을 보였다.
  • 128×128 해상도의 사전 지식 네트워크를 사용한 깊이 사전 지식 가이던스(DPG)가 dFID 25.07을 기록하며 가장 우수한 성능을 보였다. 더 낮은 해상도보다 우수했다.
  • 깊이 일관성 가이던스(DCG)와 깊이 사전 지식 가이던스(DPG) 모두 최적의 성능을 내기 위해 가이던스 스케일 40을 사용할 때 가장 우수한 결과를 보였다.
  • DAG가 생성한 이미지로 깊이 예측기 학습을 수행하면 성능이 향상되며, δ<1.25 조건에서 정확도가 77.54%에 도달했고, 가이던스 없이 생성된 샘플 대비 72.55%보다 높았다.
  • 정성적 결과 분석에서 DAG가 생성한 이미지는 기준 모델 대비 더 명확한 시나리오 레이아웃, 더 일관된 깊이 맵, 더 우수한 표면 법선 예측을 보였다.
  • 아블레이션 연구 결과, DCG와 DPG가 기하학적 타당성 향상에 독립적으로 기여하며, 두 전략을 조합할 경우 가장 우수한 성능을 기록함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.