[논문 리뷰] MMSFormer: Multimodal Transformer for Material and Semantic Segmentation
이 논문은 RGB, 편광, NIR, 열화상, 깊이 등 다양한 입력 모odalities에서 특징을 효과적으로 통합하기 위해 학습 가능한 퓨전 블록을 사용하는 새로운 다중모odal Transformer 모델인 MMSFormer을 제안한다. 퓨전 블록은 병렬 컨볼루션, 채널 주시도, 선형 퓨전을 통합하여 다중 척도 특징을 포착하고 채널별 표현을 재조정하여, 세 가지 데이터셋에서 일관된 성능 향상을 보이며 최신 기술 수준(SOTA) 성능을 달성한다.
Leveraging information across diverse modalities is known to enhance performance on multimodal segmentation tasks. However, effectively fusing information from different modalities remains challenging due to the unique characteristics of each modality. In this paper, we propose a novel fusion strategy that can effectively fuse information from different modality combinations. We also propose a new model named Multi-Modal Segmentation TransFormer (MMSFormer) that incorporates the proposed fusion strategy to perform multimodal material and semantic segmentation tasks. MMSFormer outperforms current state-of-the-art models on three different datasets. As we begin with only one input modality, performance improves progressively as additional modalities are incorporated, showcasing the effectiveness of the fusion block in combining useful information from diverse input modalities. Ablation studies show that different modules in the fusion block are crucial for overall model performance. Furthermore, our ablation studies also highlight the capacity of different input modalities to improve performance in the identification of different types of materials. The code and pretrained models will be made available at https://github.com/csiplab/MMSFormer.
연구 동기 및 목표
- 기존 방법이 특정 모달리티 쌍에 국한되거나 두 개 이상의 모달리티를 처리하지 못하는 점을 해결하기 위해, 분류 작업에서 이질적인 다중모달 데이터를 융합하는 데 도전한다.
- 아키텍처 재설계 없이도 임의의 모달리티 조합을 처리할 수 있는 유연하고 일반적인 목적의 퓨전 메커니즘을 설계한다.
- 다양한 영상 모달리티에서의 상보적 정보를 체계적으로 활용하여 재료 및 의미 분할의 정확도를 향상시킨다.
- 절단 분석을 통해 개별 모달리티가 특정 재료 클래스 인식에 기여하는 방식을 분석한다.
제안 방법
- MMSFormer는 각 입력 모달리티에서 계층적 특징을 추출하기 위해 모달리티별로 특화된 Vision Transformer 인코더를 사용한다.
- 새로운 퓨전 블록은 모달리티 간 특징을 채널 차원에 따라 연결하고, 선형 퓨전 레이어를 적용하여 특징을 통합한다.
- 융합된 특징은 다양한 커널 크기를 가진 병렬 컨볼루션 레이어를 통해 다중 척도 공간 표현을 포착한다.
- 채널별 특징 재조정은 잔차(skip) 연결에 적용된 Squeeze-and-Excitation 블록을 통해 동적으로 채널을 재가중함으로써 달성된다.
- 융합되고 향상된 특징는 MLP 기반 디코더를 통해 픽셀 단위의 분할 맵을 생성한다.
- 모델는 클래스 균형을 고려한 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, 추론 시 임의의 모달리티 조합을 지원한다.
실험 결과
연구 질문
- RQ1통합된 퓨전 블록이 RGB, AoLP, DoLP, NIR, 열화상 등 다양한 이질적인 모달리티 조합의 특징을 단일 아키텍처에서 효과적으로 융합할 수 있는가?
- RQ2단일 모달리티에서 시작하여 추가 모달리티가 도입될수록 모델의 성능이 어떻게 점진적으로 향상되는가?
- RQ3퓨전 블록의 구성 요소들(병렬 컨볼루션, 채널 주시도, 선형 퓨전) 중에서 성능에 가장 기여하는 요소는 무엇이며, 각각의 기여도는 어떠한가?
- RQ4특정 재료 클래스는 어떤 모달리티에서 가장 큰 이점을 얻으며, 그들의 고유한 물리적 특성은 모달리티 민감도와 어떻게 관련되는가?
주요 결과
- MMSFormer는 MCubeS(재료 분할), FMB(RGB-적외선), PST900(RGB-열화상) 세 가지 벤치마크 데이터셋에서 새로운 최신 기술 수준(SOTA) 성능을 달성하여, 모든 모달리티 조합에서 이전 방법을 능가한다.
- 모든 추가 모달리티가 도입될수록 성능이 점진적으로 향상되며, 이는 퓨전 블록이 새로운 입력으로부터 유용하고 상보적인 정보를 통합할 수 있음을 보여준다.
- 절단 분석 결과, 병렬 컨볼루션 레이어를 제거할 경우 mIoU가 4.51% 감소함을 확인하여, 다중 척도 특징 포착에 있어 이들의 핵심적인 역할을 입증한다.
- 채널 주시도 메커니즘이 크게 기여하며, 이를 제거할 경우 성능이 5.36% 감소하여 채널별 특징 중요도 재조정의 중요성을 확인한다.
- 선형 레이어를 제외한 모든 퓨전 구성 요소를 제거할 경우 성능이 9.25% 감소함으로써, 전체 퓨전 블록 아키텍처의 필수성을 입증한다.
- NIR 모달리티는 bitumen, 콘크리트, 플라스틱, 조약돌, 인간 클래스의 분할 성능을 크게 향상시키며, AoLP 및 DoLP는 유리, 나무, 고무 재료의 탐지에 도움을 준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.