[논문 리뷰] View Extrapolation of Human Body from a Single Image
이 논문은 단일 이미지에서 인간 신체의 새로운 시각을 합성하기 위한 기하학적 인식 딥러닝 프레임워크를 제안하며, 작업을 형태 추정과 투시도 기반의 흐름 예측으로 분해한다. 3D 기하학을 명시적으로 모델링하고 기하학적 제약 조건을 가진 이중 단계 네트워크를 사용함으로써, 특히 큰 자세 변화와 가림을 겪는 관절이 많은 변형 가능한 인간 신체에 대해 종단 간 CNN보다 현저히 향상된 정확도를 달성한다.
We study how to synthesize novel views of human body from a single image. Though recent deep learning based methods work well for rigid objects, they often fail on objects with large articulation, like human bodies. The core step of existing methods is to fit a map from the observable views to novel views by CNNs; however, the rich articulation modes of human body make it rather challenging for CNNs to memorize and interpolate the data well. To address the problem, we propose a novel deep learning based pipeline that explicitly estimates and leverages the geometry of the underlying human body. Our new pipeline is a composition of a shape estimation network and an image generation network, and at the interface a perspective transformation is applied to generate a forward flow for pixel value transportation. Our design is able to factor out the space of data variation and makes learning at each step much easier. Empirically, we show that the performance for pose-varying objects can be improved dramatically. Our method can also be applied on real data captured by 3D sensors, and the flow generated by our methods can be used for generating high quality results in higher resolution.
연구 동기 및 목표
- 단일 이미지에서 관절이 많고 변형 가능한 인간 신체의 정확한 새로운 시각을 합성하는 데 도전하는 것.
- 인간 신체 이미지에서 큰 자세 변화와 가림을 다루는 데 있어 종단 간 CNN의 한계를 극복하는 것.
- 3D 기하학을 명시적으로 모델링하고 형태 추정을 이미지 생성과 분리함으로써 시각 합성 품질을 향상시키는 것.
- 합성 데이터에서 훈련된 모델의 업샘플링된 흐름을 사용하여 고해상도 합성을 가능하게 하는 것.
- 깊이 네트워크의 도메인 적응을 통해 실제 RGB-D 데이터에서의 강인성을 입증하는 것.
제안 방법
- 이 방법은 두 단계 파이프라인을 사용한다: 먼저 전용 형태 추정 네트워크를 사용해 입력 이미지에서 깊이 맵(형태)를 추정한다.
- 투시도 투영 레이어가 추정된 깊이 맵에서 정방향 광학 흐름을 계산하여 원본 이미지 픽셀을 대상 시각 위치로 변환한다.
- 이미지 생성 네트워크는 예측된 흐름을 사용해 특징을 와핑하고 새로운 시각을 합성하며, 이미지 손실과 흐름 손실에 대한 공동 감독을 받는다.
- 아키텍처는 형태 추정, 흐름 예측, 이미지 합성의 분리를 통해 각 하위 작업의 복잡성을 감소시킨다.
- 모델는 다중 작업 감독을 통해 훈련되며, 이미지 복원에 대한 L1 손실과 예측된 흐름에 대한 흐름 일致성 손실이 사용된다.
- 실제 세계 데이터의 경우, 도메인 이동을 다루기 위해 Kinect2에서 확보한 8,000개의 RGB-D 프레임을 사용해 깊이 네트워크를 피지컬 튜닝한다.
실험 결과
연구 질문
- RQ1종단 간 딥러닝과 비교해 명시적인 3D 기하학 모델링이 관절이 많고 변형 가능한 인간 신체의 새로운 시각 합성에 도움이 되는가?
- RQ2형태 추정을 흐름 및 이미지 생성과 분리함으로써 일반화 성능 향상과 흐림 감소가 이루어지는가?
- RQ3기하학적으로 보강된 CNN이 큰 자세 변화와 자기 가림을 다루는 데 있어 순수하게 학습된 흐름 예측보다 우수한 성능을 보이는가?
- RQ4합성 데이터에서 실제 RGB-D 데이터로의 전이가 얼마나 효과적인가?
- RQ5예측된 흐름을 업샘플링된 와핑을 통해 고해상도 결과를 생성하는 데 사용할 수 있는가?
주요 결과
- 제안된 방법은 기하학적 감독 없이 직접 흐름을 예측하는 VSAP 및 VSAP+M.+F.보다 현저히 높은 흐름 정확도를 달성한다.
- 합성 벤치마크에서 이 방법은 MSE 및 SSIM 모두에서 최신 기술을 초월하며, '의자' 카테고리에서 MSE가 7.2% 감소하고 '자동차' 카테고리에서 SSIM이 1.5% 향상되었다.
- 피지컬 튜닝 없이도 실제 세계 데이터에서 자세의 구조를 유지하며, 깊이 네트워크의 피지컬 튜닝은 시각 품질을 크게 향상시킨다.
- 고해상도 결과(500×500)는 얼굴 세부 정보가 잘 보존되고 흐림이 감소하여 업샘플링된 흐름 와핑의 효과를 입증한다.
- 이 방법은 큰 자세 변화와 자기 가림에 대해 강인하며, 기준 방법 대비 다리와 머리 부위에서 더 선명한 결과를 생성한다.
- 절단 분석 결과, CNN만으로는 정밀한 픽셀 단위의 투시도 투영을 학습하는 데 어려움을 겪으며, 명시적인 기하학적 모델링의 필요성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.