[논문 리뷰] HyperDiffusion: Generating Implicit Neural Fields with Weight-Space Diffusion
HyperDiffusion는 은닉 신경 장을 인코딩하는 최적화된 다층 퍼셉트론(MLP)의 가중치 공간에서 직접 작동하는 새로운 확산 기반 생성 모델을 제안한다. 이는 고해상도의 조건 없는 3D 형상과 4D 변형 애니메이션 생성을 가능하게 하며, 볼륨 기반 기준선 대비 개선된 다양성과 시각적 품질을 달성한다. 최적화된 MLP 가중치에 기반한 트랜스포머 기반 확산 모델을 훈련시켜 3D 및 4D 생성에서 최신 기술 수준(SOTA)의 성능을 달성한다.
Implicit neural fields, typically encoded by a multilayer perceptron (MLP) that maps from coordinates (e.g., xyz) to signals (e.g., signed distances), have shown remarkable promise as a high-fidelity and compact representation. However, the lack of a regular and explicit grid structure also makes it challenging to apply generative modeling directly on implicit neural fields in order to synthesize new data. To this end, we propose HyperDiffusion, a novel approach for unconditional generative modeling of implicit neural fields. HyperDiffusion operates directly on MLP weights and generates new neural implicit fields encoded by synthesized MLP parameters. Specifically, a collection of MLPs is first optimized to faithfully represent individual data samples. Subsequently, a diffusion process is trained in this MLP weight space to model the underlying distribution of neural implicit fields. HyperDiffusion enables diffusion modeling over a implicit, compact, and yet high-fidelity representation of complex signals across 3D shapes and 4D mesh animations within one single unified framework.
연구 동기 및 목표
- 메esh나 볼륨과 같은 명시적 표현에 의존하지 않고 은닉 신경 장을 직접 생성 모델링할 수 있도록 하는 것.
- 통일된 차원에 영향을 받지 않는 프레임워크를 통해 고차원적이고 복잡한 3D 및 4D 표면 데이터를 생성하는 과제를 해결하는 것.
- 최적화된 신경 장 MLP의 압축적이고 저차원의 가중치 공간에서 확산 모델링의 가능성을 탐색하는 것.
- 훈련된 MLP의 파rameter들만을 사용하여 고해상도, 다양한, 시간적으로 일관된 3D 형상과 4D 애니메이션을 생성하는 것.
- 가중치 공간에서의 확산가 볼륨 기반 생성 모델을 초월하는 품질과 일반화 능력을 보여주는 것.
제안 방법
- 먼저 개별 3D 또는 4D 형상 인스턴스에 대해 MLP들을 오버피팅하여 가중치 공간에서 고해상도이고 압축된 표현을 생성한다.
- 최적화된 MLP 가중치와 절편을 벡터로 평탄화하여 확산 모델링에 적합한 잠재 표현을 형성한다.
- 트랜스포머 기반 아키텍처를 훈련시켜 평탄화된 가중치 벡터 위에서 직접 확산 모델링을 수행하고, 노이즈 제거 및 새로운 타당한 MLP 파rameter 세트 생성을 학습한다.
- 생성된 MLP 가중치는 표준 추론을 통해 신경 장으로 복원되며, 시각화 및 평가를 위해 메르팅 큐브스를 사용하여 표면 메쉬를 추출한다.
- 3D 및 4D 데이터에 동일하게 적용되며 아키텍처 변경 없이도 차원에 영향을 받지 않는 생성 모델링을 보여준다.
- 확산 과정은 가중치 공간에서 엔드 투 엔드로 훈련되며, 오토에코더 기반 잠재 공간이나 대규모 데이터셋에 대한 사전 훈련이 필요하지 않다.
실험 결과
연구 질문
- RQ1최적화된 신경 장 MLP의 가중치 공간에 직접적으로 확산 모델링을 효과적으로 적용할 수 있는가?
- RQ2단일 통합 프레임워크가 메시나 볼륨과 같은 명시적 기하 표현 없이도 MLP 가중치만을 사용하여 고해상도 3D 형상과 4D 애니메이션을 생성할 수 있는가?
- RQ33D 및 4D 표면 생성에서 시각적 품질과 다양성 측면에서 가중치 공간 확산은 볼륨 기반 확산과 어떻게 비교되는가?
- RQ4위치 인코딩 및 가중치 초기화와 같은 아키텍처 선택이 생성된 신경 장의 품질에 어떤 영향을 미치는가?
- RQ5학습 데이터에 기억된 것 외의 새로운, 알려지지 않은 형상으로 일반화할 수 있는가? 또는 단지 그것들 사이를 선형 보간하는 것 외에는 아닐까?
주요 결과
- HyperDiffusion는 3D 형상 생성에서 최신 기술 수준의 성능을 달성하며, 시각적 품질 평가 지표(FPD) 점수 3.49를 기록하여 볼륨 기반 기준선(4.01)을 크게 앞서간다.
- 4D 애니메이션 시퀀스 생성에서 HyperDiffusion는 FPD 점수 3.49를 기록했고, 볼륨 기준선 대비 4.01보다 뛰어난 시각적 품질을 보였다.
- 4D 생성에서 MMD(분포 거리)는 15.5로 감소하고 COV(다양성)는 45%로 증가하여 볼륨 기준선(21.9, 35%)을 초월했다.
- 절단 실험 결과, 위치 인코딩이 성능을 향상시켜 FPD를 6.40에서 3.49로 감소시키며, 단일 MLP에서 시작하는 일관된 초기화가 일반화 능력을 향상시킨다.
- 정성적 결과는 생성된 형상이 훈련 데이터에서 기억된 것이 아니며, 훈련 세트 내에서 가장 가까운 이웃들이 형태와 구조에서 유사하지 않다는 것을 보여준다.
- 모델은 형태의 무결성을 유지하면서 시간적으로 일관된 4D 애니메이션을 생성하며, 점프하거나 돌리는 등의 의미 있는 동작을 생성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.