Skip to main content
QUICK REVIEW

[논문 리뷰] LAFFNet: A Lightweight Adaptive Feature Fusion Network for Underwater Image Enhancement

Hao-Hsiang Yang, Kuan‐Chih Huang|arXiv (Cornell University)|2021. 05. 04.
Image Enhancement Techniques참고 문헌 51인용 수 11
한 줄 요약

LAFFNet는 다중 척도 컨볼루션과 채널 주의 메커니즘을 사용하는 적응형 특징 융합(affine feature fusion, AFF) 모듈을 도입하여 기존의 인코더-디코더 구조에서 사용하는 다운샘플링 및 업샘플링을 대체하는 경량이며 엔드 투 엔드 학습 가능한 CNN을 제안한다. 이 모델은 파라미터 수를 2.5M에서 0.15M로 줄여 94% 감소시켰으며, EUVP 및 UFO-120 데이터셋에서 최신 기술 수준의 성능을 달성하여 사전 처리된 작업인 색채 추출 및 깊이 추정 등의 성능을 향상시킨다.

ABSTRACT

Underwater image enhancement is an important low-level computer vision task for autonomous underwater vehicles and remotely operated vehicles to explore and understand the underwater environments. Recently, deep convolutional neural networks (CNNs) have been successfully used in many computer vision problems, and so does underwater image enhancement. There are many deep-learning-based methods with impressive performance for underwater image enhancement, but their memory and model parameter costs are hindrances in practical application. To address this issue, we propose a lightweight adaptive feature fusion network (LAFFNet). The model is the encoder-decoder model with multiple adaptive feature fusion (AAF) modules. AAF subsumes multiple branches with different kernel sizes to generate multi-scale feature maps. Furthermore, channel attention is used to merge these feature maps adaptively. Our method reduces the number of parameters from 2.5M to 0.15M (around 94% reduction) but outperforms state-of-the-art algorithms by extensive experiments. Furthermore, we demonstrate our LAFFNet effectively improves high-level vision tasks like salience object detection and single image depth estimation.

연구 동기 및 목표

  • 자원 제약이 있는 해양 로봇에 통합하기 위해 기존의 딥 러닝 기반 수중 영상 향상 모델의 높은 계산 비용과 메모리 소비 문제를 해결하기 위해.
  • 다운샘플링 및 업샘플링 연산에 의존하는 전통적인 인코더-디코더 아키텍처의 한계를 극복하기 위해.
  • 고정된 물리적 파rameter를 가정하지 않고도 다중 척도 특징 추출과 적응형 융합을 통해 높은 성능을 유지하는 경량 네트워크를 개발하기 위해.
  • 향상된 영상의 일반화 능력을 입증하여 색채 추출 및 단일 영상 기반 깊이 추정과 같은 고수준 비전 작업에 기여하기 위해.

제안 방법

  • 다양한 크기의 컨볼루션 커널을 하나의 특징 맵에 적용하여 다중 척도 특징을 추출하는 적응형 특징 융합(affine feature fusion, AFF) 모듈을 제안한다.
  • 채널 주의 메커니즘을 통합하여 각 척도의 특징 맵에 동적 가중치를 할당함으로써 특징 중요도에 따라 적응형 융합을 가능하게 한다.
  • 깊은 네트워크에서의 기울기 소실 문제를 완화하고 학습 안정성을 높이기 위해 잔차 블록을 활용한다.
  • 깊이 분리형 또는 압축형 컨볼루션을 사용하는 대신, 모든 컨볼루션 레이어의 필터 수를 줄여 모델 복잡도를 감소시킨다.
  • 다운샘플링 및 업샘플링 연산 없이, 단지 AFF 모듈과 잔차 모듈에 의존하는 U-Net 유사 아키텍처를 설계한다.
  • 향상된 영상의 정성적 품질을 향상시키기 위해 목적 함수에 인지적 손실( perceptual loss )을 통합한다.

실험 결과

연구 질문

  • RQ1경량 CNN 아키텍처가 모델 파라미터를 극적으로 줄이면서도 최신 기술 수준의 수중 영상 향상 성능을 달성할 수 있는가?
  • RQ2다중 척도 컨볼루션과 채널 주의 메커니즘을 통합한 제안된 적응형 특징 융합(AFF) 모듈이 기존의 다운샘플링 및 업샘플링을 효과적으로 대체할 수 있는가?
  • RQ3LAFFNet에서 향상된 영상 품질이 색채 추출 및 단일 영상 기반 깊이 추정과 같은 고수준 비전 작업에 얼마나 기여하는가?
  • RQ4잔차 학습과 채널 주의 메커니즘의 조합이 저조도 수중 영상 복원에서 성능 향상에 기여하는 정도는 어느 정도인가?
  • RQ5고정된 물리적 파rameter를 가정하지 않고도 파라미터 효율적인 네트워크가 다양한 수중 영상 데이터셋에서 높은 성능을 유지할 수 있는가?

주요 결과

  • LAFFNet는 기준 모델 대비 파라미터 수를 2.5M에서 0.15M로 줄여 94% 감소시켰다.
  • EUVP 데이터셋에서 LAFFNet는 UIQM 점수 3.092를 기록하여 FUnIE-GAN(2.514) 및 Deep SESR(2.638)를 포함한 모든 최신 기술 수준의 방법들을 능가했다.
  • UFO-120 데이터셋에서 LAFFNet는 PSNR 28.94와 SSIM 0.86를 기록하여 두 지표 모두 이전 방법들을 초월했다.
  • 절단 실험 결과 잔차 모듈이 +2.41 PSNR, AFF 모듈이 +0.47 PSNR 기여를 하였으며, 인지적 손실 추가로 PSNR가 +0.17 향상됨을 확인하였다.
  • LAFFNet에서 향상된 영상가 색채 추출 및 단일 영상 기반 깊이 추정 성능을 뚜렷이 향상시켰으며, 원본 영상 및 기준 모델로 향상된 영상과의 시각적 비교를 통해 이를 입증하였다.
  • 경량 아키텍처 덕분에 실세계 로봇 시스템에 효율적으로 통합 가능하며, 고수준 비전 파ipeline와의 연계를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.