[논문 리뷰] Coordinate-based Texture Inpainting for Pose-Guided Image Generation
이 논문은 자세 유도 인간 이미지 생성을 위한 좌표 기반 텍스처 복원 방법을 제안한다. 여기서 딥 네트워크는 텍스처 완성 과정에서 고주파 수치를 유지하기 위해 각 신체 표면 텍셀에 대해 소스 이미지의 좌표를 예측한다. 이 방법은 완전히 컨volutional 프레임워크 내에서 학습된 대응 관계와 유연한 스킵 연결을 활용함으로써 자세 유도 이미지 합성, 의복 이동, 얼굴 재구성에서 최신 기술 수준의 성능을 달성한다.
We present a new deep learning approach to pose-guided resynthesis of human photographs. At the heart of the new approach is the estimation of the complete body surface texture based on a single photograph. Since the input photograph always observes only a part of the surface, we suggest a new inpainting method that completes the texture of the human body. Rather than working directly with colors of texture elements, the inpainting network estimates an appropriate source location in the input image for each element of the body surface. This correspondence field between the input image and the texture is then further warped into the target image coordinate frame based on the desired pose, effectively establishing the correspondence between the source and the target view even when the pose change is drastic. The final convolutional network then uses the established correspondence and all other available information to synthesize the output image. A fully-convolutional architecture with deformable skip connections guided by the estimated correspondence field is used. We show state-of-the-art result for pose-guided image synthesis. Additionally, we demonstrate the performance of our system for garment transfer and pose-guided face resynthesis.
연구 동기 및 목표
- 단일 입력 사진으로부터 새로운 자세에서의 고품질이고 세밀한 인간 이미지를 생성하는 데 도전하는 것.
- 큰 자세 변화가 발생할 경우 일반적인 이미지 간 번역 방법에서 흔히 발생하는 흐림 현상과 텍스처 세부 정보 손실을 해결하는 것.
- 인간 신체의 대칭성과 기하학적 사전 지식을 활용하여 누락된 텍스처 영역을 효과적으로 보완하는 방법을 개발하는 것.
- 가상 시도 및 증강 현실과 같은 애플리케이션을 위해 자세 간 외관을 정확히 이동시킴으로써 현실적인 이미지 합성을 가능하게 하는 것.
제안 방법
- 이 방법은 각 신체 표면의 텍셀에 대해 직접 색상 값을 예측하는 대신, 소스 이미지 내 해당 텍셀에 대응하는 픽셀 좌표를 예측하는 좌표 기반 복원 네트워크를 사용한다.
- 이 대응 필드는 딥 컨volution 네트워크를 통해 추정되며, 이후 목표 자세의 DensePose 기술자에 의해 정의된 좌표 프레임으로 변형된다.
- 최종 이미지 합성은 유연한 스킵 연결이 추정된 대응 필드에 의해 안내되는 완전히 컨volutional인 인코더-디코더 네트워크를 통해 수행된다.
- 네트워크는 소스 이미지와 변형된 소스 좌표를 입력으로 받아 목표 자세 조건 하에 새로운 시각을 생성하도록 엔드 투 엔드로 훈련된다.
- 3D 신체 기하학과 텍스처 매핑을 모델링하기 위해 SMPL과 DensePose 표현을 사용함으로써, 다양한 자세 간 일관된 변형을 가능하게 한다.
- 절단 분석 결과는 좌표 기반 복원과 유연한 스킵 연결이 텍스처 품질 유지를 위해 필수적임을 확인한다.
실험 결과
연구 질문
- RQ1직접 RGB 복원과 비교할 때 좌표 기반 텍스처 복원이 자세 유도 이미지 합성의 시각적 품질을 크게 향상시키는가?
- RQ2큰 자세 변화와 부분 관찰 조건 하에서 제안된 방법이 고주파 텍스처 세부 정보를 얼마나 효과적으로 유지하는가?
- RQ3학습된 대응 필드에 의해 안내되는 유연한 스킵 연결이 생성된 이미지의 현실감을 얼마나 향상시키는가?
- RQ4동일한 프레임워크가 의복 이동 및 자연계 얼굴 재구성과 같은 다른 작업으로 일반화될 수 있는가?
- RQ5좌표 기반 접근 방식이 정량적 지표와 사용자 인식 모두에서 기존 최신 기술 수준의 방법을 초월하는가?
주요 결과
- Deep Fashion 데이터셋에서 제안된 방법은 SSIM 0.791, MS-SSIM 0.810, IS 4.46, LPIPS 0.169를 기록하며, 이는 이전 최신 기술 수준의 방법을 능가한다.
- 절단 분석 결과, 유연한 스킵 연결을 제거할 경우 IS는 3.23으로 감소하고 LPIPS는 0.198로 증가하여 그 중요성을 입증한다.
- 좌표 기반 복원 방법은 RGB 복원보다 LPIPS 점수를 0.029 낮추어 0.169 대비 0.198를 기록함으로써 더 뛰어난 인지 품질을 확보함을 나타낸다.
- 300-VW 데이터셋에서의 얼굴 재구성 결과, SSIM은 0.613, MS-SSIM은 0.764를 기록하여 자연계 얼굴 이미지로의 일반화 능력이 뛰어나다는 것을 보여준다.
- 사용자 연구 결과, 제안된 방법이 현실감과 텍스처 세부 정보 유지 측면에서 기존 방법보다 선호됨을 확인하였다.
- 이 방법은 현실적인 의복 이동을 가능하게 하여 가상 시도 및 패션, 증강 현실 분야에서의 실용적 적용 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.