Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Inverse Rendering for General Reflectance Photometric Stereo

Tatsunori Taniai, Takanori Maehara|arXiv (Cornell University)|2018. 02. 28.
Computer Graphics and Visualization Techniques인용 수 56
한 줄 요약

이 논문은 다중 조명 이미지에서 per-pixel 표면 법선 및 BRDF를 함께 추정하는 무감독 물리 기반 CNN 프레임워크(PSNet 및 IRNet)를 제시한다. 관찰을 렌더링하고 테스트 장면에서 직접 재구성 손실을 최소화하여, 실제 데이터에 대해 지상 진리 법선이나 사전 학습 없이도 최첨단 성능을 달성한다.

ABSTRACT

We present a novel convolutional neural network architecture for photometric stereo (Woodham, 1980), a problem of recovering 3D object surface normals from multiple images observed under varying illuminations. Despite its long history in computer vision, the problem still shows fundamental challenges for surfaces with unknown general reflectance properties (BRDFs). Leveraging deep neural networks to learn complicated reflectance models is promising, but studies in this direction are very limited due to difficulties in acquiring accurate ground truth for training and also in designing networks invariant to permutation of input images. In order to address these challenges, we propose a physics based unsupervised learning framework where surface normals and BRDFs are predicted by the network and fed into the rendering equation to synthesize observed images. The network weights are optimized during testing by minimizing reconstruction loss between observed and synthesized images. Thus, our learning process does not require ground truth normals or even pre-training on external images. Our method is shown to achieve the state-of-the-art performance on a challenging real-world scene benchmark.

연구 동기 및 목표

  • Lambertian 가정 너머의 미지의 일반 BRDF에 대한 광도 스테레오 문제를 다룬다.
  • 지상 진리 법선이나 외부 사전 학습이 필요 없는 무감독, 장면별 학습 프레임워크를 개발한다.
  • CNN 아키텍처에 물리적 반사 렌더링을 incorporated하여 복잡한 BRDF를 학습한다.
  • 대상 데이터에 직접 테스트하여 순열 불변성과 실제 세계 장면에의 적용 가능성을 보장한다.

제안 방법

  • 두 서브네트워크 구조: PSNet은 알려진 조명 방향 하에서 결합된 입력 영상들로부터 픽셀별 표면 법선 맵을 예측하고; IRNet은 렌더링 영감을 받은 BRDF 및 그림자 모델을 통해 각 관측 이미지를 합성하고 반사율 이미지를 출력한다.
  • IRNet 입력은 스펙큘러 특성 채널, PSNet 출력과의 글로벌 피처 블렌드, 그리고 관측를 재구성하기 위한 각 조명에 대한 정보를 포함하여 I = R ⊙ max(ℓ^T N, 0) 렌더링 방정식을 통해 관측 이미지를 재구성한다.
  • 엔드 투 엔드 학습은 관측 이미지와 합성 이미지 간의 재구성 손실(Lrec)과, 복잡한 장면에서 학습을 안정시키기 위한_normals에 대한 초기 단계 약한 감독(Lprior)을 최소화한다.
  • 사전 학습 없이 SGD 중 테스트 장면에서 직접 학습이 수행되며, 수렴을 개선하기 위해 재구성 손실에서 무작위 드롭아웃을 적용하고, 주어진 데이터의 학습 통계에 맞춰 BatchNorm을 설정한다.
  • 재구성 손실은 대상 객체 영역에 초점을 두고, 스펙큘러 하이라이트에 강건한 MAE 형식을 사용한다.

실험 결과

연구 질문

  • RQ1무감독, 장면별 학습이 지상 진리 법선 없이도 일반 BRDF에 대해 정확한 표면 법선을 복원할 수 있는가?
  • RQ2물리 기반 렌더링 방정식을 CNN에 도입하면 핸드메이드 모델을 넘는 광범위한 BRDF 학습이 가능한가?
  • RQ3초기 단계의 약한 감독이 무감독 또는 전체 단계 감독에 비해 수렴 및 정확도에 유의미한 이점을 주는가?
  • RQ4외부 데이터에 대한 사전 학습 없이 DiLiGenT와 같은 실제 벤치마크에서 최첨단 광도 스테레오 성능을 달성할 수 있는가?

주요 결과

  • DiLiGenT 실제 벤치마크에서 평균 점수 최상, 여덟 장면 중 다수에서 최고 점수 및 대부분의 장면에서 최고 개별 점수.
  • 스펙큘러 입력 및 글로벌 관찰 혼합을 포함한 전체 아키텍처가 최상의 정확도를 제공하며, 스펙큘러 채널 제거 시 금속 유사 표면에서 성능이 현저히 저하된다.
  • 초기 단계의 약한 감독은 학습을 안정시키고 중간값/평균 각도 오차에서 더 나은 성능을 제공, 지상 진리 법선이 없어도 효과적인 최적화를 가능하게 한다.
  • 사전 학습 없이 테스트 데이터에 네트워크 가중치를 직접 맞추는 장면별 무감독 학습이 가능하며, 기존의 여러 학습 기반 및 고전적 방법보다 우수한 성능을 보인다.
  • IRNet에 스펙큘러 큐와 물리 기반 렌더링을 도입하면 순수 데이터 기반 접근보다 복잡한 BRDF 학습이 향상된다.
  • 방법은 계산적으로 여전히 시간 소요가 크지만(장면당 수 시간 수준) 다양한 재료와 조명을 다루는 데 있어 견고성과 유연성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.