Skip to main content
QUICK REVIEW

[논문 리뷰] FishFormer: Annulus Slicing-based Transformer for Fisheye Rectification with Efficacy Domain Exploration

Shangrong Yang, Chun-Yu Lin|arXiv (Cornell University)|2022. 07. 05.
Image Enhancement Techniques인용 수 6
한 줄 요약

FishFormer는 고정된 왜곡 균일성을 유지하기 위해 고리형 조각으로 나누는 방식을 사용하는 새로운 Transformer 기반의 볼록렌즈 이미지 정규화 기법을 제안한다. 이는 전역적이고 국소적인 인식 능력을 향상시킨다. 또한 국소 텍스처 인식을 위한 집중적인 로컬 인식을 위한 레이어 어텐션 메커니즘을 도입하여 다양한 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Numerous significant progress on fisheye image rectification has been achieved through CNN. Nevertheless, constrained by a fixed receptive field, the global distribution and the local symmetry of the distortion have not been fully exploited. To leverage these two characteristics, we introduced Fishformer that processes the fisheye image as a sequence to enhance global and local perception. We tuned the Transformer according to the structural properties of fisheye images. First, the uneven distortion distribution in patches generated by the existing square slicing method confuses the network, resulting in difficult training. Therefore, we propose an annulus slicing method to maintain the consistency of the distortion in each patch, thus perceiving the distortion distribution well. Second, we analyze that different distortion parameters have their own efficacy domains. Hence, the perception of the local area is as important as the global, but Transformer has a weakness for local texture perception. Therefore, we propose a novel layer attention mechanism to enhance the local perception and texture transfer. Our network simultaneously implements global perception and focused local perception decided by the different parameters. Extensive experiments demonstrate that our method provides superior performance compared with state-of-the-art methods.

연구 동기 및 목표

  • 볼록렌즈 이미지의 전역 왜곡과 국소 대칭성을 포괄적으로 포착하는 데에 한계가 있는 CNN 및 표준 정사각형 조각 분할 방식의 문제점을 해결하기 위해.
  • 정사각형 패치 분할 방식으로 인해 발생하는 왜곡 분포의 비일관성을 해결하여 네트워크 학습을 방해하는 문제를 해결하기 위해.
  • 왜곡 매개변수의 유효 영역을 활용하여 영역별로 특화된 국소 인식 능력을 향상시키기 위해.
  • 기존에 국소 세부 정보 포착 능력이 떨어지는 Transformer 아키텍처에서 국소 텍스처 인식 능력을 향상시키기 위해.
  • 패치 기반 손실에 대해 截斷 정규분포 가중치를 사용하여 학습 안정성과 예측 정확도를 향상시키기 위해.

제안 방법

  • 각각의 고리형 패치로 나누어 왜곡이 패치 간 일관되게 유지되고, 패치 간 왜곡 변화가 점진적으로 이루어지도록 하는 고리형 조각 분할 기법을 제안한다.
  • 초기 레이어에서 얻은 풍부한 국소 텍스처 특징을 깊은 레이어로 전달하기 위해 인접한 레이어 간 어텐션을 계산하는 새로운 레이어 어텐션 메커니즘을 설계한다.
  • 왜곡 매개변수 예측의 신뢰도를 그들의 공간적 유효 영역에 따라 반영하기 위해 截斷 정규확률 밀도를 사용하는 패치 손실 가중치 기법을 도입한다.
  • Transformer 인코더를 볼록렌즈 이미지를 고리형 패치의 시퀀스로 처리하도록 구성하여 장거리 전역적 맥락 모델링을 가능하게 한다.
  • 표준 자기 어텐션을 통한 전역 인식과 레이어 어텐션을 통한 집중적 국소 인식을 통합한 아키텍처를 설계한다.
  • 다양한 데이터셋에서 다중 척도 평가 지표인 PSNR, SSIM, MS-SSIM, FID, CW-SSIM를 사용하여 네트워크를 최적화한다.

실험 결과

연구 질문

  • RQ1표준 정사각형 조각 분할 방식에 비해 고리형 조각 분할 방식이 Transformer 기반 볼록렌즈 정규화에서 왜곡 표현의 일관성을 향상시키는가?
  • RQ2왜곡 매개변수의 유효 영역은 공간적으로 변화하는가? 그리고 이를 활용하여 국소 인식 능력을 향상시킬 수 있는가?
  • RQ3레이어 어텐션 메커니즘이 일반적으로 미세한 세부 정보 처리 능력이 떨어지는 Transformer에서 국소 텍스처 인식 능력을 향상시키는가?
  • RQ4전역적 및 국소적 인식의 통합이 다양한 데이터셋에서 정규화 정확도와 일반화 능력에 어떤 영향을 미치는가?
  • RQ5성능과 계산 비용의 균형을 고려할 때 볼록렌즈 정규화에서 최적의 네트워크 깊이와 어텐션 구성은 무엇인가?

주요 결과

  • FishFormer는 Place2 데이터셋에서 PSNR 25.43, SSIM 0.8412, MS-SSIM 0.9411, FID 73.4, CW-SSIM 0.9388을 기록하며 최신 기술 수준의 방법들을 초월한다.
  • 고리형 조각 분할 방식은 정사각형 조각 분할 방식 대비 PSNR 최대 1.4 dB 향상 및 MS-SSIM 0.08 향상시키며, 특히 패치 수가 많을 경우(예: 64패치)에 두드러진 성능 향상을 보인다.
  • 레이어 어텐션 메커니즘(LTM)을 도입한 경우 기준선 대비 PSNR 0.09 향상 및 MS-SSIM 0.0085 향상되며, 국소 텍스처 강화에 효과적임을 입증한다.
  • 레이어 어텐션 메커니즘에서 첫 번째 레이어의 특징을 쿼리(q)로 사용할 경우 최고의 성능(PSNR: 25.43)을 기록하며 최적의 텍스처 전달이 이루어짐을 시사한다.
  • 최적의 네트워크 깊이는 5개의 Transformer 블록이며, 더 깊은 네트워크(예: 7개 블록)는 성능 저하를 보이며, 일정 깊이를 초월하면 수익 감소 현상이 나타남을 시사한다.
  • 다양한 데이터셋 간 테스트 결과 일반화 능력이 확인되었으며, Place2에서 학습한 FishFormer는 CelebA에서 높은 성능을 유지함으로써 강건성과 도메인 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.