Skip to main content
QUICK REVIEW

[논문 리뷰] Score-based Diffusion Models in Function Space

Jae Hyun Lim, Nikola Kovachki|arXiv (Cornell University)|2023. 02. 14.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 연속적인 기능 데이터의 생성 모델링을 가능하게 하는 수학적으로 엄밀한 프레임워크인 노이즈 제거 확산 연산자(Denoising Diffusion Operators, DDOs)를 소개한다. 함수 공간에서 직접 학습하는 점을 특징으로 하며, 정규 분포 과정을 이용한 전방 과정과 함수 값 랑주뱅 동역학을 통한 역방향 과정을 통해, 고정된 계산 비용으로 해상도에 영향을 받지 않는 생성을 달성한다. 이는 나비에-스토크스 해, InSAR 데이터, MNIST-SDF에서 고해상도 샘플링을 통해 검증되었다.

ABSTRACT

Diffusion models have recently emerged as a powerful framework for generative modeling. They consist of a forward process that perturbs input data with Gaussian white noise and a reverse process that learns a score function to generate samples by denoising. Despite their tremendous success, they are mostly formulated on finite-dimensional spaces, e.g., Euclidean, limiting their applications to many domains where the data has a functional form, such as in scientific computing and 3D geometric data analysis. This work introduces a mathematically rigorous framework called Denoising Diffusion Operators (DDOs) for training diffusion models in function space. In DDOs, the forward process perturbs input functions gradually using a Gaussian process. The generative process is formulated by a function-valued annealed Langevin dynamic. Our approach requires an appropriate notion of the score for the perturbed data distribution, which we obtain by generalizing denoising score matching to function spaces that can be infinite-dimensional. We show that the corresponding discretized algorithm generates accurate samples at a fixed cost independent of the data resolution. We theoretically and numerically verify the applicability of our approach on a set of function-valued problems, including generating solutions to the Navier-Stokes equation viewed as the push-forward distribution of forcings from a Gaussian Random Field (GRF), as well as volcano InSAR and MNIST-SDF.

연구 동기 및 목표

  • 기존의 확산 모델이 유한 차원 공간에서만 작동하여 PDE 해나 3차원 기하 데이터와 같은 기능 데이터 영역에선 제한됨을 해결하기 위해.
  • 유한 차원으로의 이산화나 잠재 공간 기반 근사 없이도, 무한 차원 함수 공간에서 점수 기반 확산 모델을 이론적으로 타당한 프레임워크로 개발하기 위해.
  • 구조화된 노이즈와 새로운 함수 공간 점수 매칭 접근법을 도입하여 효율적이고 해상도에 영향을 받지 않는 샘플링을 가능하게 하기 위해.

제안 방법

  • 입력 함수를 정규 분포 과정을 이용해 노이즈를 더한 전방 확산 과정을 수립하며, 백색 노이즈 대신 공간적으로 상관관계가 있는 구조화된 노이즈를 사용하여 다양한 해상도에서의 안정성을 확보한다.
  • 역방향 생성 과정을 함수 값 랑주앙 역학으로 정의하여 함수 공간에서의 반복적 노이즈 제거를 가능하게 한다.
  • 무한 차원 힐버트 공간으로의 노이즈 제거 점수 매칭을 일반화하여, 특이 측도를 피하고 안정적인 학습이 가능한 손실 함수를 유도한다.
  • 스펙트럼 컨볼루션과 푸리에 공간 정규화를 수정된 UNet 아키텍처에 적용하여, 해상도 불변성을 유지하는 신경 연산자를 구축한다.
  • 푸리에 변환을 통한 컨볼루션 구조의 정규 분포 측도를 활용하여 격자 기반 데이터에서 전방 과정을 효율적으로 샘플링한다.
  • 학습 안정성 향상과 함수 공간 확산에서의 샘플 품질 향상을 위해 코사인 노이즈 스케줄과 사인 블러링 스케줄을 적용한다.
Figure 1 : Overview of our approach . While in the finite-dimensional case, inputs are discretized, we work directly in function space, on continuous inputs, here 1D functions on $\mathbb{{R}}$ . Noise is first added to the training samples during the forward process. A Neural Operator is used to es
Figure 1 : Overview of our approach . While in the finite-dimensional case, inputs are discretized, we work directly in function space, on continuous inputs, here 1D functions on $\mathbb{{R}}$ . Noise is first added to the training samples during the forward process. A Neural Operator is used to es

실험 결과

연구 질문

  • RQ1유한 차원 이산화나 잠재 공간 매핑에 의존하지 않고도 점수 기반 확산 모델을 무한 차원 함수 공간으로 엄밀하게 확장할 수 있는가?
  • RQ2함수 공간 상의 확률 측도에 대해 안정적이고 해상도에 영향을 받지 않는 점수 매칭 목표를 어떻게 유도할 수 있는가?
  • RQ3해상도가 증가함에 따라 모델 용량을 늘리지 않고도 함수 공간에서 효율적인 학습을 가능하게 하는 노이즈 구조는 무엇인가?
  • RQ4다양한 기능 데이터 유형에 대해 기존 방법과 비교했을 때 샘플 품질과 일반화 능력은 어떻게 되는가?
  • RQ5이 프레임워크는 PDE 해나 부호 거리 함수와 같은 복잡한 기능 데이터의 고해상도 샘플을 생성할 수 있는가?

주요 결과

  • 제안된 DDO 프레임워크는 해상도에 영향을 받지 않는 생성을 달성하며, 추론 비용이 데이터 해상도와 무관하여 연속 함수에서의 확장 가능한 샘플링이 가능하다.
  • 나비에-스토크스 해에 대해 정규 분포 랜덤 필드 입력에서 고해상도의 유체 역학적 복잡성 정확하게 복원한 샘플을 생성하여 성능을 입증하였다.
  • Volcano InSAR 데이터셋에서 DDO는 세밀한 공간적 세부 정보를 갖는 현실적인 간섭도를 생성하며, 이산화에 의존하는 기존 기준 모델을 능가하였다.
  • MNIST-SDF에서 모델은 날카롭고 다양한 구조적 정확도를 갖춘 손글씨 숫자의 부호 거리 함수 표현을 생성하였다.
  • 컨볼루션을 통한 정규 분포 측도로 생성된 구조화된 노이즈의 사용은 안정적인 학습을 가능하게 하였으며, 이전의 무한 차원 확산 모델에서 발생하는 무한 손실 문제를 피하였다.
  • UNet 기반 아키텍처에서의 스펙트럼 컨볼루션과 푸리에 공간 정규화는 해상도 불변성을 보장하고 다양한 입력 격자 간의 일반화 능력을 향상시켰다.
(a)
(a)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.