Skip to main content
QUICK REVIEW

[논문 리뷰] Delivering Arbitrary-Modal Semantic Segmentation

Jiaming Zhang, Ruiping Liu|arXiv (Cornell University)|2023. 03. 02.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 Self-Query Hub(SQ-Hub)를 통한 동적 특징 선택과 Parallel Pooling Mixer(PPX)를 통한 효율적 인차모달 신호 추출을 가능하게 하는 Self-Query Hub(SQ-Hub)를 통해 1~81개의 모odal을 유연하게 융합할 수 있는 새로운 임의의 모odal 의미 분할 모델인 CMNeXt를 제안한다. 이는 여섯 가지 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하며, 특히 RGB만을 사용한 기준 대비 +9.10% 향상된 66.30% mIoU를 기록한 새로운 DeLiVER 데이터셋에서 높은 성능을 보였다.

ABSTRACT

Multimodal fusion can make semantic segmentation more robust. However, fusing an arbitrary number of modalities remains underexplored. To delve into this problem, we create the DeLiVER arbitrary-modal segmentation benchmark, covering Depth, LiDAR, multiple Views, Events, and RGB. Aside from this, we provide this dataset in four severe weather conditions as well as five sensor failure cases to exploit modal complementarity and resolve partial outages. To make this possible, we present the arbitrary cross-modal segmentation model CMNeXt. It encompasses a Self-Query Hub (SQ-Hub) designed to extract effective information from any modality for subsequent fusion with the RGB representation and adds only negligible amounts of parameters (~0.01M) per additional modality. On top, to efficiently and flexibly harvest discriminative cues from the auxiliary modalities, we introduce the simple Parallel Pooling Mixer (PPX). With extensive experiments on a total of six benchmarks, our CMNeXt achieves state-of-the-art performance on the DeLiVER, KITTI-360, MFNet, NYU Depth V2, UrbanLF, and MCubeS datasets, allowing to scale from 1 to 81 modalities. On the freshly collected DeLiVER, the quad-modal CMNeXt reaches up to 66.30% in mIoU with a +9.10% gain as compared to the mono-modal baseline. The DeLiVER dataset and our code are at: https://jamycheung.github.io/DELIVER.html.

연구 동기 및 목표

  • 의미 분할 분야에서 임의의 수의 모달을 융합하는 데 대한 연구 부족, 특히 실제 센서 고장 및 악조건 하에서의 융합에 대응할 수 있는 방법이 부족한 점을 해결하기 위해.
  • 고정된 모달 쌍을 위한 설계된 기존 방법의 한계를 극복하여 확장성과 내구성을 향상시키기 위해.
  • RGB, 깊이, LiDAR, 이벤트, 편광, 빛장 등 다양한 모달을 동적으로 통합할 수 있는 통합 프레임워크를 개발하여 저비용 계산 부담을 유지하기 위해.
  • 모달 간 상호보완적 정보를 활용하여 부분적인 센서 고장 및 극악의 기상 조건 하에서도 강력한 의미 분할 성능 유지를 위해.
  • 실제 고장 및 환경 조건 하에서의 임의의 모달 의미 분할 연구를 지원하기 위해 DeLiVER라는 종합적 벤치마크를 구축하기 위해.

제안 방법

  • 비대칭 브랜치를 갖춘 Hub2Fuse 패러다임을 제안: 하나는 RGB를 위한 브랜치, 다른 하나는 보조 모달을 위한 브랜치로, 융합의灵活性와 효율성을 향상시킴.
  • 모든 보조 모달에서 유의미한 특징을 동적으로 선택하여 융합하기 전에 처리하는 Self-Query Hub(SQ-Hub)를 설계함. 이는 모달당 약 0.01M 파라미터만 추가함.
  • 다양한 모달 간 특징을 효율적으로 추출하기 위해 모달 간 병렬 공간 풀링을 적용하는 경량 모듈인 Parallel Pooling Mixer(PPX)를 도입함.
  • PPX를 교차 융합 모듈과 통합하여 RGB와 같은 조밀한 모달과 LiDAR, 이벤트와 같은 희박한 모달을 효과적으로 처리함.
  • RGB 브랜치에는 MHSA 블록을, 보조 브랜치에는 PPX를 사용함으로써, 자기주의 주의가 조밀한 표현을 처리하는 데 뛰어나고, PPX가 교차모달 지식을 추출하는 데 뛰어나다는 것을 입증함.
  • SQ-Hub, PPX 및 그 구성 요소(예: SE 블록, FRM/FFM 모듈)의 효과를 검증하기 위해 광범위한 추상화 분석(ablation studies)을 수행함.

실험 결과

연구 질문

  • RQ11~81개의 다양한 모달 조합에 대해 통합된 모델이 의미 분할에서 최신 기술 수준(SoTA) 성능을 달성할 수 있는가?
  • RQ2모달 수가 증가함에 따라 CMNeXt 모델이 높은 정확도를 유지하면서도 파라미터 증가율을 낮출 수 있는가?
  • RQ3LiDAR 진동 또는 부분적 고장과 같은 센서 고장 상황에서 모델이 얼마나 강력한 성능 유지를 할 수 있는가?
  • RQ4PPX 모듈이 컨볼루션, 풀링, 주의 기반 대안들과 비교해 별도의 모달에서 구분 가능한 특징을 얼마나 효과적으로 추출하는가?
  • RQ5SQ-Hub 메커니즘이 동적으로 모달에 종속되지 않는 특징 선택을 가능하게 하여 융합 효율성과 성능 향상을 이끌 수 있는가?

주요 결과

  • DeLiVER 벤치마크에서 CMNeXt는 RGB, 깊이, 이벤트, LiDAR를 포함한 4모달 설정에서 66.30% mIoU를 기록했으며, RGB 전용 기준 대비 +9.10% 향상된 성능을 보였다.
  • UrbanLF-Real에서 이전 SoTA 방법 대비 +3.90% mIoU 향상, MCubeS에서는 +8.68% 향상되어 다양한 데이터셋 간 강력한 일반화 능력을 입증함.
  • PPX 모듈은 MHSA, ConvNeXt, PoolFormer, MSCA 등 모든 테스트 블록 중에서 가장 높은 mIoU(66.30%)를 기록했으며, 파라미터 수는 58.73M, 연산량은 65.42 GFLOPs에 그쳤음.
  • 추상화 분석 결과, PPX 내부의 SE 블록을 제거하면 mIoU가 3.03% 감소함으로써 채널 기반 주의가 교차모달 특징 학습에서 중요한 역할을 함을 확인함.
  • FRM 및 FFM 모듈은 교차모달 상호작용을 크게 향상시키며, 이들을 제거할 경우 mIoU가 1.89% 감소함을 입증함.
  • LiDAR 진동과 같은 센서 고장 상황에서도 CMNeXt는 안정적인 성능을 유지하는 반면, 기존 방법인 CMX 및 HRFuser는 심각한 성능 저하를 보임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.