Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Rectangling for Image Stitching: A Learning Baseline

Lang Nie, Chun-Yu Lin|arXiv (Cornell University)|2022. 03. 08.
Advanced Vision and Imaging인용 수 7
한 줄 요약

이 논문은 이미지 스티칭에서 이미지 레이아웃 정규화를 위한 최초의 일단계 딥러닝 접근법을 제안한다. 완전 컨volution 네트워크와 잔차 점진 회귀를 사용하여 붙인 이미지에서 초기 메쉬를 예측하며, 종단 간 손실 함수를 통해 경계 직사각형성, 메쉬 형태 유지, 시각적 콘텐츠 충실도를 강제한다. 이 방법은 기존의 이단계적 접근법보다 선형 및 비선형 구조를 더 잘 유지하며, 새로 제작한 데이터셋(DIR-D)에서 우수한 정량적·정성적 성능을 달성한다.

ABSTRACT

Stitched images provide a wide field-of-view (FoV) but suffer from unpleasant irregular boundaries. To deal with this problem, existing image rectangling methods devote to searching an initial mesh and optimizing a target mesh to form the mesh deformation in two stages. Then rectangular images can be generated by warping stitched images. However, these solutions only work for images with rich linear structures, leading to noticeable distortions for portraits and landscapes with non-linear objects. In this paper, we address these issues by proposing the first deep learning solution to image rectangling. Concretely, we predefine a rigid target mesh and only estimate an initial mesh to form the mesh deformation, contributing to a compact one-stage solution. The initial mesh is predicted using a fully convolutional network with a residual progressive regression strategy. To obtain results with high content fidelity, a comprehensive objective function is proposed to simultaneously encourage the boundary rectangular, mesh shape-preserving, and content perceptually natural. Besides, we build the first image stitching rectangling dataset with a large diversity in irregular boundaries and scenes. Experiments demonstrate our superiority over traditional methods both quantitatively and qualitatively.

연구 동기 및 목표

  • 기존의 이단계적 이미지 레이아웃 정규화 방법이 포트레이트와 같은 비선형 구조에서 어려움을 겪고 왜곡을 야기하는 데서 비롯되는 한계를 해결한다.
  • 반복적 메쉬 최적화가 필요 없이 효율적인 병렬 계산이 가능한 일단계 딥러닝 솔루션을 개발한다.
  • 경계 직사각형성, 메쉬 형태 유지, 정성 자연스러움을 균형 있게 고려한 종합적 손실 함수를 도입하여 레이아웃 정규화 이미지의 콘텐츠 충실도를 향상시킨다.
  • 딥러닝 레이아웃 정규화 모델을 훈련하고 평가하기 위해 쌍방향으로 붙인 이미지와 직사각형 이미지가 포함된 최초의 대규모이고 다양한 데이터셋(DIR-D)을 구축한다.

제안 방법

  • 고정된 목표 메쉬를 사전 정의하고, 완전 컨volution 네트워크와 잔차 점진 회귀를 사용하여 초깃값 메쉬만 예측하는 일단계 딥러닝 프레임워크를 제안한다.
  • 경계 항목(직사각형 출력을 강제하기 위해), 메쉬 항목(메쉬 형태 유지), 콘텐츠 항목(정성 자연스러움 확보)을 조합한 다중 구성 요소 손실 함수를 설계한다.
  • 실제 직사각형 이미지에 역방향 레이아웃 정규화 변환을 적용하여 생성한 새로운 DIR-D 데이터셋을 사용해 네트워크를 종단 간으로 훈련한다.
  • 수천 개의 합성 샘플에 대해 수동 필터링을 적용하여 고품질과 다양성을 확보하여 총 6,358개의 청소된 훈련 샘플을 확보한다.
  • 잔차 회귀기반 점진적 정밀화 전략을 통해 초깃값 메쉬 예측을 반복적으로 향상시켜 일반화 능력을 향상시키고 균일하지 않은 경계를 줄인다.
  • 콘텐츠 손실에서 의미적 이해를 활용하여 인간 얼굴이나 자연 풍경과 같은 복잡한 비선형 구조를 유지한다.

실험 결과

연구 질문

  • RQ1일단계 딥러닝 접근법이 기존의 이단계 메쉬 변형 방법보다 선형 및 비선형 구조를 모두 유지하면서 이미지 레이아웃 정규화에서 뛰어난 성능을 낼 수 있는가?
  • RQ2잔차 점진 회귀 전략이 다양한 이미지 콘텐츠에서 메쉬 예측 품질과 일반화 능력을 얼마나 향상시키는가?
  • RQ3경계, 메쉬, 콘텐츠 항목을 균형 있게 조합한 종합적 손실 함수가 레이아웃 정규화 이미지의 정성 충실도를 얼마나 향상시키는가?
  • RQ4다양한 붙인 이미지-직사각형 쌍을 포함한 새로 제작한 데이터셋(DIR-D)이 딥러닝 레이아웃 정규화 모델의 훈련과 평가에 효과적으로 기여하는가?
  • RQ5기존의 레이아웃 정규화 실패나 왜곡이 발생하는 저품질 입력에 대해서도 제안된 방법이 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 일단계 딥러닝 방법은 기존의 이단계적 방법보다 정성적으로 뛰어난 성능을 보이며, 특히 기존 방법에서 눈에 띄는 왜곡이 발생하는 포트레이트와 같은 비선형 구조를 잘 유지한다.
  • 사용자 연구 결과, 참가자 70%가 제안된 방법의 결과를 He 등(2023)의 방법보다 선호하여 더 높은 콘텐츠 충실도를 정성적으로 선호함을 시사한다.
  • 크로스 데이터셋 평가에서, SPW, LCP, UDIS의 붙인 이미지에 대해 조건이 열악한 입력에서도 기준 방법보다 왜곡이 적게 발생함을 입증하였다.
  • ablative 연구 결과, 손실 함수의 콘텐츠 항목과 메쉬 항목이 성능 향상에 크게 기여하며, 잔차 점진 회귀 전략이 도전적인 케이스에서 균일하지 않은 경계를 줄이는 데 효과적임을 확인하였다.
  • 최적의 메쉬 해상도는 $8\times6$로, $16\times12$에 비해 성능 향상은 미미하지만 계산 비용은 크게 증가하므로 성능과 비용의 균형을 고려한 최적 선택으로 판단되었다.
  • 실제 스티칭 실패나 왜곡, 노이즈가 포함된 저품질 입력에 대해서도 잘 일반화되어, 프로젝티브 왜곡과 노이즈가 존재하는 입력 이미지에서도 고품질의 레이아웃 정규화 결과를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.