[논문 리뷰] Attention-based Dual Supervised Decoder for RGBD Semantic Segmentation
이 논문은 RGBD 세분화에서 인코더와 디코더 양쪽에서 특징 융합을 향상시키는 어텐션 기반 이중 감독 디코더를 제안한다. 인코더에 다중 모달 융합 모듈과 이중 분지 디코더에 피라미드 감독을 도입함으로써, 교차 모달 표현 학습과 학습 수렴을 향상시켜 NYUDv2 (52.5% mIoU) 및 SUN-RGBD (62.1% mAcc.) 데이터셋에서 최신 기준 성능을 달성한다.
Encoder-decoder models have been widely used in RGBD semantic segmentation, and most of them are designed via a two-stream network. In general, jointly reasoning the color and geometric information from RGBD is beneficial for semantic segmentation. However, most existing approaches fail to comprehensively utilize multimodal information in both the encoder and decoder. In this paper, we propose a novel attention-based dual supervised decoder for RGBD semantic segmentation. In the encoder, we design a simple yet effective attention-based multimodal fusion module to extract and fuse deeply multi-level paired complementary information. To learn more robust deep representations and rich multi-modal information, we introduce a dual-branch decoder to effectively leverage the correlations and complementary cues of different tasks. Extensive experiments on NYUDv2 and SUN-RGBD datasets demonstrate that our method achieves superior performance against the state-of-the-art methods.
연구 동기 및 목표
- 세분화에서 RGB와 깊이 정보의 다중 모달 융합을 효과적으로 수행하는 문제를 해결하기 위해.
- 이중 분지 디코더 아키텍처를 도입하여 인코더와 디코더 간의 학습 불균형 문제를 해결하기 위해.
- 관련 작업에서의 보조 감독을 활용한 다중 작업 정교화를 통해 세분화 성능을 향상시키기 위해.
- 다양한 스케일에서 교차 모달 상관관계를 활용하여 특징 표현 학습을 향상시키기 위해.
제안 방법
- RGB 및 깊이 스트림에서 깊이 있는 다중 수준 쌍화된 보완 특징을 추출하고 융합하기 위해 인코더에 어텐션 기반 다중 모달 융합(AMF) 모듈을 도입한다.
- 주 분지가 ASPP를 사용해 다중 스케일의 맥락을 처리하는 세분화를 수행하고, 보조 분지는 정규 방향 추정 또는 깊이 추정과 같은 작업 지도 감독을 제공하는 이중 분지 디코더를 활용한다.
- 주 분지에서 피라미드 감독을 적용하여 깊은 표현 학습을 향상시키고 경계 정확도를 개선한다.
- 이중 단계 학습 전략을 적용한다: 먼저 깊이 또는 정규 방향 지도 감독을 사용한 보조 분지로 사전 학습한 후, 세분화 지도 감독을 사용해 미세 조정하여 학습 안정성과 수렴 속도를 향상시킨다.
- 스킵 연결과 특징 병합을 활용하여 디코더 경로 전반에서 공간적 세부 정보를 유지하고 특징 맵을 풍부하게 한다.
- 백본으로 ResNet-50를 사용하고, 최신 기준 방법과의 공정한 비교를 위해 단일 스케일 추론을 적용한다.
실험 결과
연구 질문
- RQ1다중 수준에서 RGB와 깊이 모달을 함께 고려하는 추론이 세분화 정확도를 향상시키는가?
- RQ2다중 작업 정교화를 갖춘 이중 분지 디코더가 학습 수렴과 모델 성능에 어떤 영향을 미치는가?
- RQ3어떤 정도로 어텐션 기반 다중 모달 융합이 요소별 또는 게이트드 융합보다 특징 표현을 향상시키는가?
- RQ4관련 작업(예: 정규 방향 추정)에서의 보조 감독이 어려운 카테고리에서의 세분화 강인성을 향상시키는가?
주요 결과
- 제안된 방법은 동일한 평가 프rotocol 하에서 NYUDv2에서 52.5% mIoU를 달성하여 이전 최신 기준 방법을 초월한다.
- SUN-RGBD 데이터셋에서 62.1% mAcc를 기록하여 이전 최고 성능 방법 대비 4.1% 향상되었으며, 대규모 데이터에서 강력한 성능을 입증한다.
- 이중 분지 디코더는 학습을 크게 안정화시켜 손실 진동을 줄이고 수렴 속도를 높였다.
- 침대, 커튼, 옷장, 샤워기, 보드와 같은 어려운 카테고리에서 특히 뛰어난 성능을 보여, 모호하거나 복잡한 장면에서도 강인함을 입증한다.
- 사전 학습 단계에서 깊이 지도 감독만을 사용했음에도 불구하고, PAP 및 PSD와 같은 다중 작업 학습 기반 방법보다 mAcc에서 뛰어난 성능을 보여 효과적인 특징 활용을 입증한다.
- 정성적 결과는 특히 배경과 유사한 색상 영역에서 분할 오류가 감소하고 경계 정확도가 향상되었음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.