Skip to main content
QUICK REVIEW

[논문 리뷰] Light Field Spatial Super-resolution via Deep Combinatorial Geometry Embedding and Structural Consistency Regularization

Jing Jin, Junhui Hou|arXiv (Cornell University)|2020. 04. 05.
Advanced Vision and Imaging참고 문헌 36인용 수 7
한 줄 요약

이 논문은 조합 기하 구조 임bedding를 활용해 모든 라이트 필드(LF) 뷰 간의 보완 정보를 융합하고, 구조 인식 정규화 모듈을 통해 파라렐랙스 일致성을 유지하는 딥러닝 프레임워크를 제안한다. 이 방법은 최신 기술 대비 평균 PSNR를 1.0 dB 이상 향상시키며, 계산 비용도 감소시켜 최상의 성능을 달성한다.

ABSTRACT

Light field (LF) images acquired by hand-held devices usually suffer from low spatial resolution as the limited sampling resources have to be shared with the angular dimension. LF spatial super-resolution (SR) thus becomes an indispensable part of the LF camera processing pipeline. The high-dimensionality characteristic and complex geometrical structure of LF images make the problem more challenging than traditional single-image SR. The performance of existing methods is still limited as they fail to thoroughly explore the coherence among LF views and are insufficient in accurately preserving the parallax structure of the scene. In this paper, we propose a novel learning-based LF spatial SR framework, in which each view of an LF image is first individually super-resolved by exploring the complementary information among views with combinatorial geometry embedding. For accurate preservation of the parallax structure among the reconstructed views, a regularization network trained over a structure-aware loss function is subsequently appended to enforce correct parallax relationships over the intermediate estimation. Our proposed approach is evaluated over datasets with a large number of testing images including both synthetic and real-world scenes. Experimental results demonstrate the advantage of our approach over state-of-the-art methods, i.e., our method not only improves the average PSNR by more than 1.0 dB but also preserves more accurate parallax details, at a lower computational cost.

연구 동기 및 목표

  • 제한된 센서 샘플링으로 인해 휴대용 라이트 필드 카메라에서 저해상도 문제가 발생하는 것을 해결한다.
  • 기존 방법들이 뷰 간 보완 정보를 완전히 활용하지 못하는 한계를 극복한다.
  • 재구성된 뷰 간에 정확한 파라렐랙스 구조를 유지하여 3D 장면의 기하학적 정밀도를 확보한다.
  • 품질과 속도를 모두 향상시키는 효율적인 엔드 투 엔드 학습 기반 프레임워크를 개발한다.

제안 방법

  • 모든 뷰 간의 각도 뷰 간 조합 상관관계를 기하학적 인식 임베딩 메커니즘을 통해 학습함으로써 개별적으로 각 LF 뷰를 슈퍼레졸루션 처리하는 All-to-One 슈퍼레졸루션 모듈을 적용한다.
  • 고해상도 공간에서 정확한 파라렐랙스 관계를 강제로 유지하기 위해 구조 인식 손실 함수로 훈련된 구조 일致성 정규화 네트워크를 도입한다.
  • 4차원 라이트 필드의 이중 평면 파arameterization을 사용하며, 각 뷰는 고정된 각도 위치에서의 2차원 슬라이스에 해당하여 에피폴라 평면 기하학을 모델링할 수 있다.
  • 기하학적 관계를 통해 파라렐랙스 구조를 수식으로 기술한다: $ L_{oldsymbol{u}}(oldsymbol{x}) = L_{oldsymbol{u}'}(oldsymbol{x} + d(oldsymbol{u}' - oldsymbol{u})) $, 여기서 $ d $ 는 디스parity이다.
  • 중간 재구성 결과를 기대되는 에피폴라 기하학과 비교하여 구조 일치성을 최소화하도록 정규화 모듈을 훈련한다.
  • 다단계 훈련 파이프라인을 활용한다: 먼저 All-to-One SR 모듈을 훈련하고, 이후 정규화 브랜치를 포함한 전체 모델을 피나이닝한다.

실험 결과

연구 질문

  • RQ1모든 라이트 필드 뷰 간의 보완 정보를 효과적으로 융합하여 슈퍼레졸루션 성능을 향상시킬 수 있는가?
  • RQ2학습된 정규화 모듈이 재구성된 라이트 필드에서 장면의 기하학적 파라렐랙스 구조를 어느 정도 유지할 수 있는가?
  • RQ3구조 인식 손실 함수가 에피폴라 평면 이미지(EPI)의 정밀도를 향상시키고, 구조 일치성을 강화하는 데 기여하는가?
  • RQ4제안된 방법이 최신 기술 대비 더 높은 재구성 품질과 더 낮은 계산 비용을 달성하는가?

주요 결과

  • 제안된 방법은 스탠포드 리트로 아카이브 및 HCI 데이터셋을 포함한 벤치마크 데이터셋에서 최신 기술 대비 평균 PSNR를 1.0 dB 이상 향상시켰다.
  • 구조 일치성 정규화 모듈은 'Occlusion_43_eslf' 및 'Antiques_dense'와 같은 도전적인 장면에서 PSNR 향상에 최대 0.5 dB 기여했다.
  • ResLF 및 기타 학습 기반 방법 대비 더 높은 재구성 품질(PSNR/SSIM)과 더 빠른 추론 속도를 달성했으며, RTX 2080 Ti에서 4× 재구성 시간은 7.43초였다.
  • EPI 시각화 결과에서 제안된 방법은 더 선명하고 일관된 직선을 생성하여 파라렐랙스 구조 보존 능력이 뛰어남을 보여주었다.
  • 정량적 LF 에지 파라렐랙스 정밀도-재현율 곡선 분석 결과, 제안된 방법의 결과는 우상단 모서리에 더 가까워, 뛰어난 구조 일치성을 입증했다.
  • 실제 데이터에서는 All-to-All 기반 모델 대비 PSNR가 0.6 dB 이상 높고, 합성 데이터에서는 1.0 dB 이상 높게 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.