[논문 리뷰] Transformer-Based Attention Networks for Continuous Pixel-Wise Prediction
이 논문은 단일 영상 깊이 추정 및 표면 법선 추정과 같은 연속적인 픽셀 단위 예측 작업을 위한 하이브리드 CNN-Transformer 아키텍처인 TransDepth를 제안한다. ResNet 기반 구조에 비전 트랜스포머 블록을 통합하고 통합된 어텐션 게이트 디코더를 적용함으로써, 장거리 의존성을 효과적으로 모델링하면서도 국소적 세부 정보를 유지할 수 있으며, NYU, KITTI 및 ScanNet 벤치마크에서 최신 기술 수준의 성능을 달성한다.
While convolutional neural networks have shown a tremendous impact on various computer vision tasks, they generally demonstrate limitations in explicitly modeling long-range dependencies due to the intrinsic locality of the convolution operation. Initially designed for natural language processing tasks, Transformers have emerged as alternative architectures with innate global self-attention mechanisms to capture long-range dependencies. In this paper, we propose TransDepth, an architecture that benefits from both convolutional neural networks and transformers. To avoid the network losing its ability to capture local-level details due to the adoption of transformers, we propose a novel decoder that employs attention mechanisms based on gates. Notably, this is the first paper that applies transformers to pixel-wise prediction problems involving continuous labels (i.e., monocular depth prediction and surface normal estimation). Extensive experiments demonstrate that the proposed TransDepth achieves state-of-the-art performance on three challenging datasets. Our code is available at: https://github.com/ygjwd12345/TransDepth.
연구 동기 및 목표
- 밀도 있는 예측 작업에서 컨볼루션 신경망이 장거리 공간적 의존성을 모델링하는 데 한계가 있음을 해결하기 위해.
- 픽셀 단위의 회귀 작업에서 순수한 트랜스포머를 사용할 경우 국소적 인덕티브 바이어스가 손실되는 문제를 극복하기 위해.
- 다중 스케일 특징을 융합하고 디코더 내 특징 표현을 향상시키는 새로운 어텐션 게이트 디코더를 제안하기 위해.
- CNN과 트랜스포머를 조합하여 연속 레이블 예측, 특히 단일 영상 깊이 및 표면 법선 추정에서의 성능 향상을 입증하기 위해.
- 깊이 및 법선 추정 작업 모두에 대해 표준 벤치마크 데이터셋에서 새로운 최신 기술 수준의 성능을 확립하기 위해.
제안 방법
- 장거리 의존성 모델링을 향상시키기 위해 ResNet-50 기반 구조에 비전 트랜스포머 블록을 통합하면서도 국소적 공간적 인덕티브 바이어스를 유지하기 위해.
- 다중 스케일 특징을 융합하기 위해 별도의 채널별 및 공간별 어텐션 메커니즘을 적용하는 통합 어텐션 게이트 디코더를 제안하기 위해.
- 게이트드 어텐션을 활용하여 다양한 스케일의 특징 맵을 동적으로 가중함으로써 특징 전파 및 표현 학습을 향상시키기 위해.
- 디코더가 다수의 인코더 스테이지(예: f³, f⁴, f⁵)에서 특징을 수신하는 다중 스케일 융합 전략을 사용하여 맥락을 풍부하게 하기 위해.
- 자기 어텐션 메커니즘을 활용하여 특징 맵 내 모든 픽셀 간의 장거리 의존성을 모델링함으로써 전역 맥락 모델링을 가능하게 하기 위해.
- 깊이 및 표면 법선 추정 작업을 위한 표준 회귀 손실 함수를 사용하여 네트워크를 엔드 투 엔드로 훈련하기 위해.
실험 결과
연구 질문
- RQ1트랜스포머는 단일 영상 깊이 추정 및 표면 법선 추정과 같은 연속적인 픽셀 단위 예측 작업에 효과적으로 적용될 수 있는가?
- RQ2트랜스포머의 전역 모델링 능력과 CNN의 국소적 인덕티브 바이어스를 어떻게 조합하여 고밀도 예측 성능을 향상시킬 수 있는가?
- RQ3보다 나은 표현을 위해 공간적 및 채널별 어텐션을 유지하면서 다중 스케일 특징을 융합하는 최적의 디코더 설계는 무엇인가?
- RQ4제안된 통합 어텐션 게이트 디코더는 장거리 및 국소적 의존성을 포괄하는 데 있어 표준 어텐션 또는 스킵 커넥션 기반 디코더보다 우수한 성능을 내는가?
- RQ5하이브리드 CNN-Transformer 아키텍처는 NYU, KITTI 및 ScanNet과 같은 표준 벤치마크에서 최신 기술 수준의 결과를 달성할 수 있는가?
주요 결과
- NYU 데이터셋에서 단일 영상 깊이 추정 작업에 대해 δ < 1.25 지표에서 0.900의 새로운 최신 기술 수준 성능을 달성하였다.
- KITTI 데이터셋에서 δ < 1.25 지표에서 0.956을 기록하여 깊이 예측 분야에서 새로운 SOTA를 수립하였다.
- NYU에서의 표면 법선 추정 작업에 대해 11.25° 지표에서 61.7%의 성능을 기록하여 새로운 최신 기술 수준 결과를 확립하였다.
- 절단 실험 결과, 세 개의 인코더 특징(f³, f⁴, f⁵)을 융합할 경우 최고의 성능를 기록하였으며, 추가 확장은 과적합을 유도하는 것으로 나타났다.
- ResNet-50와 ViT-B/16를 조합한 하이브리드 백본이 NYU 깊이 데이터셋의 모든 지표에서 순수한 ResNet 및 순수한 ViT 백본보다 뛰어난 성능을 보였다.
- 정성적 어텐션 맵을 통해 어텐션 게이트 디코더가 이미지의 다양한 영역에서 다중 스케일 공간적 의존성을 성공적으로 포착하고 있음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.