[논문 리뷰] Hybrid Local-Global Transformer for Image Dehazing.
이 논문은 단일 이미지의 안개 제거를 위한 하이브리드 로컬-글로벌 비전 트랜스포머인 HyLoG-ViT를 제안한다. 이는 컨볼루션을 통한 특징 융합를 통해 계산 비용을 줄이고 특징 표현을 향상시키기 위해 로컬 및 글로벌 어텐션 경로를 결합한다. 아키텍처는 반사율, 음영, 안개 제거 이미지 예측을 위한 공유 인코더와 세 개의 디코더를 통합하며, 보완적 특징 선택 모듈을 통해 성능을 향상시켜 동질적, 비동질적, 야간 안개 제거 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Recently, the Vision Transformer (ViT) has shown impressive performance on high-level and low-level vision tasks. In this paper, we propose a new ViT architecture, named Hybrid Local-Global Vision Transformer (HyLoG-ViT), for single image dehazing. The HyLoG-ViT block consists of two paths, the local ViT path and the global ViT path, which are used to capture local and global dependencies. The hybrid features are fused via convolution layers. As a result, the HyLoG-ViT reduces the computational complexity and introduces locality in the networks. Then, the HyLoG-ViT blocks are incorporated within our dehazing networks, which jointly learn the intrinsic image decomposition and image dehazing. Specifically, the network consists of one shared encoder and three decoders for reflectance prediction, shading prediction, and haze-free image generation. The tasks of reflectance and shading prediction can produce meaningful intermediate features that can serve as complementary features for haze-free image generation. To effectively aggregate the complementary features, we propose a complementary features selection module (CFSM) to select the useful ones for image dehazing. Extensive experiments on homogeneous, non-homogeneous, and nighttime dehazing tasks reveal that our proposed Transformer-based dehazing network can achieve comparable or even better performance than CNNs-based dehazing models.
연구 동기 및 목표
- 이미지 안개 제거 작업에서 표준 비전 트랜스포머가 로컬 및 글로벌 이미지 종속성을 효율적으로 포착하는 데에 한계가 있음을 해결한다.
- 자기 어텐션 메커니즘의 계산 복잡도를 줄이면서도 저수준 시각 작업을 위한 표현 특징 학습을 유지한다.
- 반사율과 음영의 내재적 이미지 분해를 공동으로 학습하고 안개 제거 이미지 생성을 통해 안개 제거 성능을 향상시킨다.
- 다양한 예측 헤드에서 유용한 특징을 효과적으로 선택하고 융합할 수 있는 메커니즘을 개발하여 안개 제거 성능을 향상시킨다.
- 야간 및 비동질적 안개 이미지를 포함한 다양한 안개 제거 시나리오에서 CNN 기반 모델과 비교해도 열등하지 않은 성능을 달성한다.
제안 방법
- 로컬 비전 트랜스포머 경로를 통해 국소적 특징 추출을 수행하고, 글로벌 비전 트랜스포머 경로를 통해 장거리 종속성 모델링을 수행하는 하이브리드 로컬-글로벌 비전 트랜스포머 블록(HyLoG-ViT 블록)을 제안한다.
- 컨볼루션 레이어를 사용해 로컬 및 글로벌 경로의 특징을 융합하여 국소적 인덕티브 바이어스와 글로벌 컨텍스트 인식 능력을 결합한다.
- 공유 인코더와 세 개의 디코더(반사율 예측, 음영 예측, 안개 제거 이미지 생성)를 갖춘 안개 제거 네트워크를 설계한다.
- 반사율 및 음영 헤드에서 유용한 특징을 동적으로 선택하고 융합하여 안개 제거 이미지 복원에 활용하기 위해 보완적 특징 선택 모듈(CFSM)을 도입한다.
- 반사율, 음영, 안개 제거 손실을 공동 최적화하는 다중 작업 학습 목표를 사용해 네트워크를 엔드 투 엔드로 훈련시킨다.
- 내재적 이미지 분해를 보조 신호로 활용하여 최종 안개 제거 출력의 품질과 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1하이브리드 로컬-글로벌 트랜스포머 아키텍처가 로컬 및 글로벌 특징 학습을 균형 있게 조절함으로써 표준 비전 트랜스포머보다 이미지 안개 제거 성능을 뛰어나게 할 수 있는가?
- RQ2반사율 및 음영 예측을 포함한 내재적 이미지 분해를 통합할 경우, 직접 엔드 투 엔드 안개 제거와 비교해 안개 제거 이미지의 품질과 일반화 능력이 향상되는가?
- RQ3보완적 특징 선택 모듈이 다수의 예측 헤드에서 가장 정보가 많은 특징을 효과적으로 식별하고 활용하여 안개 제거 성능을 향상시킬 수 있는가?
- RQ4제안된 HyLoG-ViT는 기존의 CNN 및 트랜스포머 기반 모델과 비교해 계산 복잡도를 얼마나 줄일 수 있으며, 안개 제거 정확도를 유지하거나 향상시킬 수 있는가?
- RQ5비동질적 및 야간 안개 이미지를 포함한 다양한 안개 제거 시나리오에서 모델의 일반화 능력은 어떠한가?
주요 결과
- 제안된 HyLoG-ViT는 동질적 및 비동질적 안개 제거 벤치마크에서 최신 기술 수준의 CNN 기반 안개 제거 모델과 비교해 유사하거나 뛰어난 성능을 달성한다.
- 야간 안개 제거에 대해 강력한 일반화 능력을 보이며, 많은 기존 모델이 실패하는 도전적인 시나리오에서 뛰어난 성능을 발휘한다.
- 내재적 이미지 분해(반사율 및 음영 예측)를 활용함으로써 최종 안개 제거 이미지의 품질을 향상시키는 의미 있는 중간 특징을 제공한다.
- 보완적 특징 선택 모듈(CFSM)은 특징 활용을 효과적으로 향상시켜 가장 관련 있는 특징에 집중함으로써 더 나은 안개 제거 결과를 기여한다.
- 하이브리드 로컬-글로벌 설계 덕분에 표준 글로벌 자기 어텐션 메커니즘보다 계산 복잡도를 줄여 모델의 효율성을 높였다.
- 광범위한 아블레이션 스터디를 통해 이중 경로 아키텍처와 CFSM를 갖춘 다중 디코더 프레임워크의 각 구성 요소의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.