[논문 리뷰] Inverse Graphics with Probabilistic CAD Models
이 논문은 변형 가능한 3D 메쉬와 그들의 시점 배치를 확률적 프로그램으로 모델링함으로써 3D 시각 작업을 위한 근사 베이지안 추론을 가능하게 하는 확률적 CAD(PCAD) 프레임워크를 제안한다. 하이퍼볼릭 몬테카를로, 메트로폴리스-해스팅스 제안, 그리고 합성 데이터에서 학습된 판별적 데이터 기반 제안을 조합하여 단일 이미지에서의 3D 인간 자세 추정 및 물체 형상 복원 작업에서 최신 기술 수준(SOTA) 성능을 달성한다.
Recently, multiple formulations of vision problems as probabilistic inversions of generative models based on computer graphics have been proposed. However, applications to 3D perception from natural images have focused on low-dimensional latent scenes, due to challenges in both modeling and inference. Accounting for the enormous variability in 3D object shape and 2D appearance via realistic generative models seems intractable, as does inverting even simple versions of the many-to-many computations that link 3D scenes to 2D images. This paper proposes and evaluates an approach that addresses key aspects of both these challenges. We show that it is possible to solve challenging, real-world 3D vision problems by approximate inference in generative models for images based on rendering the outputs of probabilistic CAD (PCAD) programs. Our PCAD object geometry priors generate deformable 3D meshes corresponding to plausible objects and apply affine transformations to place them in a scene. Image likelihoods are based on similarity in a feature space based on standard mid-level image representations from the vision literature. Our inference algorithm integrates single-site and locally blocked Metropolis-Hastings proposals, Hamiltonian Monte Carlo and discriminative data-driven proposals learned from training data generated from our models. We apply this approach to 3D human pose estimation and object shape reconstruction from single images, achieving quantitative and qualitative performance improvements over state-of-the-art baselines.
연구 동기 및 목표
- 자연 이미지 이해에서 복잡한 3D에서 2D 렌더링 매핑을 뒤집는 데서 기인하는 비가역성 문제를 해결하기 위해.
- 비모수적 사전 분포(예: 가우시안 프로세스 포함)를 사용하여 확률적 CAD 프로그램으로 풍부한 3D 형상 및 외관 변동성을 모델링하기 위해.
- 실제 3D 시각 작업을 위한 고차원이며 혼합 이산-연속 잠재 공간에서 효율적이고 정확한 추론을 가능하게 하기 위해.
- 판별적 데이터 기반 제안을 생성 모델링 프레임워크에 통합하여 추론 속도와 정확도를 향상시키기 위해.
- 생성 모델을 사용하여 단일 자연 이미지에서 스케일링 가능한 명시적 3D 시점 인식을 수행할 수 있는지의 타당성을 입증하기 위해.
제안 방법
- 비모수적 사전 분포(예: 가우시안 프로세스 포함)에서 3D 메쉬와 애핀 변환을 샘플링하는 확률적 CAD(PCAD) 프로그램을 사용하여 확률적 시점 생성기를 정의한다.
- 3D 시점 샘플에서 중위 수준의 이미지 표현(예: 윤곽선 맵, HOG 유사 기능)을 생성하기 위해 일반적인 렌더링 엔진을 사용하여 가능도 계산을 수행한다.
- 단일 사이트 및 국소 블록화된 메트로폴리스-해스팅스, 하이퍼볼릭 몬테카를로, 그리고 훈련된 검출기에서 유도된 판별적 제안을 조합한 하이브리드 추론 전략을 적용한다.
- 합성 훈련 데이터에서 DPM 검출기의 잠재 변수에 대한 커널 밀도 추정을 통해 판별적 제안을 학습함으로써 제안 품질을 향상시킨다.
- 중위 수준 표현 공간에서 거리 척도를 사용하여 렌더링된 기능과 실제 이미지 기능을 비교하여 이미지 가능도를 정의한다.
- 전체 시스템을 생성적 확률적 그래픽스 프로그램으로 간주하여 3D 인식을 위한 엔드 투 엔드 베이지안 역전치를 가능하게 한다.
실험 결과
연구 질문
- RQ1확률적 CAD 프로그램은 자연 이미지 내에서 3D 형상과 외관 변동성을 스케일링 가능하고 현실적으로 모델링할 수 있는가?
- RQ2복잡한 다대다 렌더링 매핑이 존재하는 고차원 혼합 이산-연속 잠재 공간에서 효율적 추론을 어떻게 달성할 수 있는가?
- RQ3데이터 기반 판별적 제안은 생성적 3D 시각 모델의 베이지안 추론 속도와 정확도를 어느 정도 향상시킬 수 있는가?
- RQ4완전히 생성적이고 근사적 베이지안 접근 방식이 3D 인간 자세 추정 및 물체 복원에서 판별적 기준 모델을 능가할 수 있는가?
- RQ5명시적 3D 시점 표현과 확률적 추론을 사용하여 단일 자연 이미지에서 풍부한 3D 시점 해석을 수행할 수 있는 시스템을 구축하는 것이 가능한가?
주요 결과
- 제안된 방법은 사전에 객체를 분할하지 않은 상태에서도 SIRFS 및 기타 최신 기술 수준(SOTA) 기준보다 유의미한 정량적 성능 향상을 달성한다.
- 합성 데이터에서 학습된 판별적 제안은 수렴 속도를 크게 향상시키고 사후 정확도를 향상시켜, 제안이 있는지 없는지에 따라 100개의 독립 MCMC 체인을 통해 입증되었다.
- 학습된 제안을 사용한 추론은 더 빠르게 수렴하고 더 높은 사후 가능도에 도달하며, 여러 테스트 케이스에서 일관된 성능 향상을 보였다.
- 복잡한 에너지 곡면에서 국소 최소값을 성공적으로 회피하는 것으로 나타났으며, 사전에서 사후로의 점진적 정밀화를 보여주는 추론 경로가 이를 뒷받침한다.
- 비모수적 사전 분포를 통해 3D 메쉬 구성요소와 변형에 대해 일반화가 잘 되어 있어, 새로운 객체 유형과 복잡한 형상에 대해 잘 작동한다.
- 비록 단일 자연 이미지에서라도 명시적 3D 메쉬와 정확한 자세 추정을 위한 정성적 결과를 성공적으로 도출할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.