[논문 리뷰] Explicitly disentangling image content from translation and rotation with spatial-VAE
Spatial-VAE는 VAE에서 회전/이동을 콘텐츠로부터 분리하기 위해 제너레이터를 픽셀 좌표에 의존하도록 만듦으로써 명시적 자세 추론과 변환된 이미지, EM, 은하 데이터에서의 재구성 개선을 가능하게 한다.
Given an image dataset, we are often interested in finding data generative factors that encode semantic content independently from pose variables such as rotation and translation. However, current disentanglement approaches do not impose any specific structure on the learned latent representations. We propose a method for explicitly disentangling image rotation and translation from other unstructured latent factors in a variational autoencoder (VAE) framework. By formulating the generative model as a function of the spatial coordinate, we make the reconstruction error differentiable with respect to latent translation and rotation parameters. This formulation allows us to train a neural network to perform approximate inference on these latent variables while explicitly constraining them to only represent rotation and translation. We demonstrate that this framework, termed spatial-VAE, effectively learns latent representations that disentangle image rotation and translation from content and improves reconstruction over standard VAEs on several benchmark datasets, including applications to modeling continuous 2-D views of proteins from single particle electron microscopy and galaxies in astronomical images.
연구 동기 및 목표
- Semantic content가 자세 변환(예: 회전 및 평행이동)과 분리되도록 이미지의 잠재 표현을 학습하려는 동기 부여.
- 좌표 조건부 VAE를 제안하여 비지도 방식으로 콘텐츠와 함께 회전 및 이동을 함께 추론한다.
- 벤치마크 및 도메인 데이터셋(MNIST 변형, cryo-EM 시뮬레이션, Galaxy Zoo)에서 재구성 및 진짜 콘텐츠 분리의 개선을 시연한다.
제안 방법
- 이미지 가능도 p_g(y^i|x^i,z)가 좌표 x^i(및 회전/변환 버전)와 잠재 z를 받는 MLP에 의해 계산되는 spatial 제너레이터 네트워크를 정의한다.
- 좌표 공간에서 회전 및 평행이동을 직접 모델링하기 위해 좌표를 변환하므로 p_g(y|z,θ,Δx)가 x^i R(θ) + Δx에 의존한다.
- VAE 목적 하에서 근사 후방 q(z,θ,Δx|y) = N(μ(y),σ(y)^2 I)로 회전 θ, 변위 Δx, 비구조적 잠재 z를 추론한다.
- 로그-가능도와 z, θ, Δx에 대한 KL 항을 결합한 변분 하한(Eq. 3에 대해 균일한 사전(prior)이 바람직할 때 θ에 대한 KL 대안을 제공)으로 구성한다.
- 추정 중 θ와 Δx가 변하도록 하는 학습 스킴을 제공하여 변환된 콘텐츠 인자와 콘텐츠 인자를 끝에서 끝으로 학습할 수 있게 한다.
- 실험적으로 Spatial-VAE를 기본 VAE 및 포즈가 고정된 버전과 비교하여 분리 및 재구성 향상을 입증한다.
실험 결과
연구 질문
- RQ1지도 없이 연속 포즈 인자(회전 및 평행이동)와 의미 있는 콘텐츠를 분리하도록 VAE를 학습시킬 수 있는가?
- RQ2좌표 기반 생성 및 포즈 추론을 명시적으로 모델링하면 이미지가 무작위로 회전되고 이동될 때 재구성이 개선되는가?
- RQ3시뮬레이션 cryo-EM 투사 및 은하 이미지와 같은 도메인 데이터에서 포즈에 독립적으로 실제 콘텐츠 변화를 회복할 수 있는가?
- RQ4학습된 잠재 공간이 콘텐츠를 회전/이동으로부터 분리하고 도메인 간 의미 있는 보간을 반영하는가?
주요 결과
- Spatial-VAE는 변형된 MNIST 변형에서 ELBO 면에서 vanilla VAE를 능가하며, 특히 비구조적 잠재 차원이 작을 때 그렇다.
- 모델은 콘텐츠(z)와 회전 θ, 평행이동 Δx를 분리하는 것을 학습하며, 포즈가 콘텐츠 표현에서 제거된 학습 데이터 매니폴드를 통해 이를 입증한다.
- 시뮬레이션된 cryo-EM 데이터에서 θ 없이 한 개의 비제한 잠재 변수와 포즈 추론으로 구성된 Spatial-VAE가 구성 변화를 포즈를 고려하지 않고 포착하여 vanilla VAE를 능가한다.
- Galaxy Zoo 및 EM 데이터셋에서 Spatial-VAE는 회전/이동에 독립적으로 은하 형태를 반영하는 변환 불변 표현을 학습한다.
- 잠재 공간의 보간은 콘텐츠의 매끄러운 전이를 보여주는 반면 포즈는 분리되어 있어 요인들의 견고한 분리를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.