Skip to main content
QUICK REVIEW

[논문 리뷰] AsymFormer: Asymmetrical Cross-Modal Representation Learning for Mobile Platform Real-Time RGB-D Semantic Segmentation

Siqi Du, Weixi Wang|arXiv (Cornell University)|2023. 09. 25.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

AsymFormer는 이질적인 양면 모달 표현 학습 프레임워크를 제안하여 모바일 플랫폼에서 실시간 RGB-D 세분화를 구현한다. 깊이에 대해 경량 트랜스포머 백본을, RGB에 대해 CNN을 사용하여 중복을 줄인다. NYUv2에서 52.0% mIoU를 달성하고, 65 FPS의 추론 속도(혼합 정밀도 사용 시 79 FPS)를 기록하여 기존 방법 대비 뛰어난 속도-정확도 균형을 확보하면서도 파라미터 수를 최소화한다. 국소화된 주의 및 상호모달 상관관계 모듈을 통해 달성된다.

ABSTRACT

Understanding indoor scenes is crucial for urban studies. Considering the dynamic nature of indoor environments, effective semantic segmentation requires both real-time operation and high accuracy.To address this, we propose AsymFormer, a novel network that improves real-time semantic segmentation accuracy using RGB-D multi-modal information without substantially increasing network complexity. AsymFormer uses an asymmetrical backbone for multimodal feature extraction, reducing redundant parameters by optimizing computational resource distribution. To fuse asymmetric multimodal features, a Local Attention-Guided Feature Selection (LAFS) module is used to selectively fuse features from different modalities by leveraging their dependencies. Subsequently, a Cross-Modal Attention-Guided Feature Correlation Embedding (CMA) module is introduced to further extract cross-modal representations. The AsymFormer demonstrates competitive results with 54.1% mIoU on NYUv2 and 49.1% mIoU on SUNRGBD. Notably, AsymFormer achieves an inference speed of 65 FPS (79 FPS after implementing mixed precision quantization) on RTX3090, demonstrating that AsymFormer can strike a balance between high accuracy and efficiency.

연구 동기 및 목표

  • 대칭적 이중 브랜치 네트워크가 RGB-D 세분화에서 계산 비용을 두 배로 증가시키지만 정확도 향상은 비례하지 않는 비효율성을 해결하기 위해.
  • 경량 깊이 브랜치와 강력한 RGB 브랜치를 갖춘 이질적 백본 설계를 통해 모델 중복을 줄이기 위해.
  • 공간-채널 주의를 동시에 모델링하는 국소화된 주의 기반 특징 선택(LAFS) 모듈을 도입하여 특징 융합 효율성을 향상시키기 위해.
  • 최소한의 파라미터 증가로 다중 모달 자기 유사성을 캡처하는 상호모달 주의(CMA) 모듈을 통해 상호모달 표현 학습을 향상시키기 위해.
  • 실시간 추론을 우선시하면서도 세분화 품질을 훼손하지 않고 모바일 로봇 플랫폼에 적합한 뛰어난 속도-정확도 균형을 달성하기 위해.

제안 방법

  • AsymFormer는 RGB 특징에 대해 CNN 기반 백본을, 깊이 특징에 대해 더 작은 파라미터 효율적인 트랜스포머를 사용하여 계산 중복을 줄인다.
  • 국소화된 주의 기반 특징 선택(LAFS) 모듈은 학습 가능한 채널 가중치와 공간 주의를 동시에 사용하여 공간-채널 주의 가중치를 병렬로 계산함으로써 빠르고 선택적인 융합을 가능하게 한다.
  • LAFS는 학습 가능한 가중치를 통해 모달 간 차이를 추정하여 공간 주의를 모델링함으로써, 고속 추론을 유지하면서도 특징 선택을 향상시킨다.
  • 상호모달 주의(CMA) 모듈은 다양한 모달 간 자기 유사성을 모델링하여 상호모달 표현을 향상시키며, 최소한의 파라미터 오 overhead로 기여한다.
  • 특징 융합은 공간적 및 채널적 종속성에 기반하여 RGB 및 깊이 브랜치의 기여도를 동적으로 가중하는 주의 맵에 의해 유도된다.
  • 추론 속도를 추가로 향상시키기 위해 혼합 정밀도 추론을 적용하였으며, 정확도 저하 없이 RTX 3090에서 79 FPS를 달성하였다.
Figure 1: Overview of AsymFormer.
Figure 1: Overview of AsymFormer.

실험 결과

연구 질문

  • RQ1이질적 백본 설계가 정확도를 훼손하지 않으면서 다중 모달 세분화에서 파라미터 중복을 줄일 수 있는가?
  • RQ2실시간 성능을 확보하면서도 공간적 및 채널적 주의의 정밀도를 유지하기 위해 특징 선택을 어떻게 최적화할 수 있는가?
  • RQ3최소한의 파라미터 증가로 다중 모달 자기 유사성 특징이 세분화 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4경량화된 교차 주의 메커니즘이 실시간 환경에서 상호모달 표현 학습을 효과적으로 향상시킬 수 있는가?
  • RQ5제안된 방법이 기존 SOTA 방법 대비 모바일 로봇 플랫폼에서 더 나은 속도-정확도 균형을 달성하는가?

주요 결과

  • AsymFormer는 NYUv2 데이터셋에서 52.0% mIoU를 달성하여 대부분의 기존 방법보다 정확도와 속도 면에서 뛰어나다.
  • RTX 3090에서 AsymFormer는 정밀도를 유지한 채 65 FPS의 추론 속도를 기록하였고, 혼합 정밀도 양자화를 사용할 경우 79 FPS에 도달하여 기존 방법 대비 뚜렷한 속도 우수성을 보였다.
  • 오직 33M 파라미터로도 52.0% mIoU를 유지하여 높은 효율성과 낮은 파라미터 수를 입증하였다.
  • SUNRGBD 데이터셋에서는 49.1% mIoU를 달성하여, 데이터셋 내 깊이 이미지 품질이 낮음에도 불구하고 경쟁 가능한 성능을 보였다.
  • 시각화 결과 LAFS는 CBAM보다 더 일관되고 정보량이 풍부한 주의 맵을 생성하며, 가장자리 보존과 객체 일관성 면에서 뛰어난 성능을 보였다.
  • 절단 실험 결과 이질적 백본, LAFS, CMA 모듈의 조합이 속도 및 정확도 면에서 뚜렷한 향상을 이끌었다.
Figure 2: Difference between CBAM and LAFS’s spatial attention map.
Figure 2: Difference between CBAM and LAFS’s spatial attention map.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.