Skip to main content
QUICK REVIEW

[논문 리뷰] S3Net: A Single Stream Structure for Depth Guided Image Relighting

Hao-Hsiang Yang, Wei‐Ting Chen|arXiv (Cornell University)|2021. 05. 03.
Advanced Vision and Imaging참고 문헌 36인용 수 4
한 줄 요약

S3Net는 원본 이미지와 가이드 이미지, 그들의 깊이 맵을 입력으로 받아 인코더-디코더 아키텍처에 주목과 잔차 모듈을 통합하여 단일 스트림 딥 러닝 프레임워크로, 깊이 유도 임의의 이미지 재조명을 수행한다. 이는 파형 기반 SSIM 손실을 사용하여 시각적 품질을 향상시켜 NTIRE 2021 챌린지에서 VIDIT 데이터셋에서 0.6969의 SSIM을 기록하며 3위를 차지하였다.

ABSTRACT

Depth guided any-to-any image relighting aims to generate a relit image from the original image and corresponding depth maps to match the illumination setting of the given guided image and its depth map. To the best of our knowledge, this task is a new challenge that has not been addressed in the previous literature. To address this issue, we propose a deep learning-based neural Single Stream Structure network called S3Net for depth guided image relighting. This network is an encoder-decoder model. We concatenate all images and corresponding depth maps as the input and feed them into the model. The decoder part contains the attention module and the enhanced module to focus on the relighting-related regions in the guided images. Experiments performed on challenging benchmark show that the proposed model achieves the 3 rd highest SSIM in the NTIRE 2021 Depth Guided Any-to-any Relighting Challenge.

연구 동기 및 목표

  • 깊이 맵을 사용하여 원본 이미지를 가이드 이미지의 조명 조건에 맞게 재조명하는 새로운 과제인 깊이 유도 임의의 이미지 재조명 문제를 해결하기 위해.
  • 이중 스트림 네트워크의 계산 부담을 피하면서도 RGB 및 깊이 특징을 효과적으로 융합할 수 있는 효율적인 단일 스트림 아키텍처를 설계하기 위해.
  • 주목 기반 모듈과 개선된 특징 정제 모듈을 디코더에 통합하여 방향성 조명 및 그림자 전달 품질을 향상시키기 위해.
  • 이산 웨이블릿 변환 기반 다중 척도 손실 함수를 최적화하여 전역 및 국소 이미지 정밀도를 향상시키기 위해.
  • NTIRE 2021 깊이 유도 임의의 이미지 재조명 챌린지에서 최첨단 성능을 달성하기 위해.

제안 방법

  • 모델은 원본 이미지와 가이드 이미지, 그들의 해당 깊이 맵을 결합하여 단일 6채널 입력 텐서로 구성된 단일 스트림 인코더-디코더 아키텍처를 사용한다.
  • 인코더는 다중 척도 감지 영역 확장을 위한 Res2Net 블록을 활용하여 계층적 특징을 추출한다.
  • 디코더는 재조명 관련 영역을 강조하기 위한 주목 모듈과 그림자 및 조명 일관성을 향상시키기 위한 특징 맵 정제를 위한 개선된 모듈을 통합한다.
  • 학습 중에는 다중 척도 구조적 세부 정보를 캡처함으로써 시각적 품질을 향상시키기 위해 파형 기반 SSIM 손실(L_{W-SSIM})을 사용한다.
  • 색상, 구조적, 시각적 정밀도를 위해 L_{Cha}, L_{SSIM}, L_{Per}을 조합한 손실 함수를 사용하며, 최고 성능 설정에서는 L_{SSIM} 대신 L_{W-SSIM}을 사용한다.
  • 네트워크는 VIDIT 데이터셋에서 엔드 투 엔드로 학습되며, 1024×1024 이미지당 추론 시간은 2.042초이다.

실험 결과

연구 질문

  • RQ1이중 스트림 복잡성 없이도 단일 스트림 네트워크가 RGB와 깊이 특징을 효과적으로 융합하여 임의의 이미지 재조명을 수행할 수 있는가?
  • RQ2주목 및 개선된 모듈의 통합이 그림자 및 조명 전달 품질 향상에 어떻게 기여하는가?
  • RQ3기본 SSIM 대비 파형 SSIM 손실을 사용할 경우 이미지 재조명 작업에서 시각적 품질 향상 정도는 어느 정도인가?
  • RQ4깊이 맵을 유일한 공간 가이드로 사용할 때, 다양한 조명 조건(색온도 및 방향성 조명 포함)에 일반화할 수 있는가?
  • RQ5기존 접근법 대비 제안된 방법의 NTIRE 2021 벤치마크 성능은 어떠한가?

주요 결과

  • 제안된 S3Net는 SSIM 및 MPS 측면에서 NTIRE 2021 깊이 유도 임의의 이미지 재조명 챌린지에서 3위를 기록하였으며, 검증 SSIM은 0.7022, 테스트 SSIM은 0.6784였다.
  • 테스트 세트에서 PSNR는 19.2212, LPIPS는 0.1566을 기록하여 강력한 시각적 및 구조적 정밀도를 입증하였다.
  • 제거 실험 결과, 깊이 맵 사용(설정 2)이 단순 이미지만 사용한 경우(설정 1)보다 SSIM을 0.6821에서 0.6913으로 향상시켰다.
  • 기본 SSIM 대신 파형 SSIM으로 교체(설정 3)하면 SSIM은 0.6969로 향상되고 PSNR는 19.1281로 상승하여 다중 척도 손실의 효과를 확인하였다.
  • 시각적 비교 결과, 파형 SSIM 손실이 실제값에 더 가까운 재조명 이미지를 생성하며, 그림자 제거 및 조명 전달 품질이 향상됨을 확인하였다.
  • 깊이 맵 정보가 제한된 큰 모호한 그림자가 있는 이미지에서는 실패를 보였으며, 이는 향후 연구에서 향상된 3D 추론이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.