Skip to main content
QUICK REVIEW

[논문 리뷰] Customize Segment Anything Model for Multi-Modal Semantic Segmentation with Mixture of LoRA Experts

Chenyang Zhu, Bin Xiao|arXiv (Cornell University)|2024. 12. 05.
Big Data and Business IntelligenceBusiness, Management and Accounting인용 수 3
한 줄 요약

이 논문은 사전 훈련된 Segment Anything Model(SAM)을 RGB가 아닌 시각적 모달리티(예: 깊이, 이벤트 데이터)에 적응시키기 위해 원본 SAM 가중치를 동결하면서 모달리티별 LoRA 어댑터를 훈련하는 Mixture of LoRA Experts(MLE-SAM) 프레임워크를 제안한다. 이는 다중 모달 세분화에 대해 최신 기술 수준의 성능을 달성하며, 특히 모달리티가 누락된 조건에서 MUSES 데이터셋에서 기존 방법 대비 32.15% 향상된 mIoU 성능을 기록한다.

ABSTRACT

The recent Segment Anything Model (SAM) represents a significant breakthrough in scaling segmentation models, delivering strong performance across various downstream applications in the RGB modality. However, directly applying SAM to emerging visual modalities, such as depth and event data results in suboptimal performance in multi-modal segmentation tasks. In this paper, we make the first attempt to adapt SAM for multi-modal semantic segmentation by proposing a Mixture of Low-Rank Adaptation Experts (MoE-LoRA) tailored for different input visual modalities. By training only the MoE-LoRA layers while keeping SAM's weights frozen, SAM's strong generalization and segmentation capabilities can be preserved for downstream tasks. Specifically, to address cross-modal inconsistencies, we propose a novel MoE routing strategy that adaptively generates weighted features across modalities, enhancing multi-modal feature integration. Additionally, we incorporate multi-scale feature extraction and fusion by adapting SAM's segmentation head and introducing an auxiliary segmentation head to combine multi-scale features for improved segmentation performance effectively. Extensive experiments were conducted on three multi-modal benchmarks: DELIVER, MUSES, and MCubeS. The results consistently demonstrate that the proposed method significantly outperforms state-of-the-art approaches across diverse scenarios. Notably, under the particularly challenging condition of missing modalities, our approach exhibits a substantial performance gain, achieving an improvement of 32.15% compared to existing methods.

연구 동기 및 목표

  • RGB가 아닌 시각적 모달리티(예: 깊이, 이벤트 데이터)에 사전 훈련된 Segment Anything Model(SAM)을 적용하는 데 도전하는 것. 이러한 모달리티는 고유한 특성을 지니며 SAM의 성능을 떨어뜨린다.
  • RGB, 깊이, 이벤트, LiDAR와 같은 이질적인 모달리티를 융합할 때 발생하는 교차 모달 불일치 및 최적화되지 않은 특징 통합 문제를 해결하는 것.
  • 기존 모델 가중치를 동결하면서 경량 LoRA 어댑터만 미세조정하여 SAM의 강력한 일반화 능력과 제로샷 성능를 유지하는 것.
  • 모달리티가 누락되거나 노이즈가 있는 실생활 환경에서의 강건성을 향상시키기 위해 동적 MoE 라우팅 메커니즘과 다중 척도 특징 융합을 도입하는 것.
  • 표준 조건과 악조건 모두에서 DELIVER, MUSES, MCubeS와 같은 다양한 다중 모달 벤치마크에서 뛰어난 세분화 정확도를 달성하는 것.

제안 방법

  • 각 모달리티(예: RGB, 깊이, 이벤트)에 전용 LoRA 어댑터를 할당하는 Mixture of Low-Rank Adaptation Experts(MoE-LoRA) 프레임워크를 도입하여 모달리티별 특화된 적응을 수행한다.
  • 다양한 모달리티 간의 특징 융합을 향상시키기 위해 동적으로 주의 가중치를 계산하는 동적 MoE 라우팅 메커니즘을 설계하여 가중치가 부여된 융합 특징을 생성한다. 이는 교차 모달 일관성과 통합을 향상시킨다.
  • SAM의 세분화 헤드를 수정하여 다중 척도 특징을 추출하고 융합할 수 있는 보조 헤드를 추가함으로써 특징 표현력과 세분화 정확도를 향상시킨다.
  • 모델의 원본 SAM 가중치를 동결하면서 오직 LoRA 어댑터와 보조 헤드만 훈련함으로써 SAM의 일반화 능력 유지 보장을 확보한다.
  • 원본 헤드와 보조 헤드를 모두 활용하는 이중 경로 마스크 예측 전략을 구현하여 다중 척도 융합을 통해 마스크 품질을 향상시킨다.
  • MoE-LoRA 프레임워크를 DELIVER, MUSES, MCubeS 세 가지 벤치마크에 적용하고, 노이즈 및 모달리티 누락 조건 하에서 광범위한 추론 및 강건성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1기존 모델 가중치를 미세조정하지 않고 LoRA 기반 미세조정이 RGB가 아닌 시각적 모달리티에 대해 사전 훈련된 Segment Anything Model을 효과적으로 적응시킬 수 있는가?
  • RQ2Mixture of Experts 라우팅 메커니즘이 이질적인 데이터에서의 다중 모달 특징 융합과 교차 모달 불일치 문제를 어떻게 개선할 수 있는가?
  • RQ3보조 세분화 헤드를 통한 다중 척도 특징 융합이 다중 모달 환경에서 세분화 성능을 얼마나 향상시키는가?
  • RQ4기존 최신 기술 수준의 방법들과 비교했을 때, 제안된 MLE-SAM 프레임워크는 모달리티가 누락되거나 노이즈가 있는 실생활 도전 상황에서 어떻게 성능을 발휘하는가?
  • RQ5각 구성 요소(MoE 라우팅, 다중 척도 융합, 보조 헤드)가 다중 모달 세분화의 전체 성능 향상에 기여하는 정도는 어느 정도인가?

주요 결과

  • DELIVER 데이터셋에서 네 가지 모달리티(R-D-E-L)를 사용할 때, MLE-SAM은 최신 기술 수준의 방법들보다 +4.9% 향상된 mIoU 성능을 기록한다.
  • 세 가지 모달리티(F-E-L)를 포함한 MUSES 데이터셋에서 MLE-SAM은 +28.14% 향상된 mIoU 성능을 기록하여 복잡한 다중 모달 시나리오에서도 뛰어난 성능을 입증한다.
  • 모달리티가 누락된 조건에서 MLESAM은 MUSES 데이터셋에서 기존 방법들 대비 32.15% 향상된 mIoU 성능을 기록하여 뛰어난 강건성을 입증한다.
  • 노이즈가 있는 테스트 조건에서 MLE-SAM은 CWSAM과 SAM-LoRA를 모두 압도하며, 랜덤 노이즈 조건 하에서 RGB 모달리티에서 32.42% 향상된 mIoU 성능을 기록한다.
  • MoE 라우팅 메커니즘은 밀도가 높은(RGB, 깊이) 및 희박한(이벤트, LiDAR) 모달리티 간의 기여도를 효과적으로 균형 잡으며, 가우시안 노이즈 및 랜덤 노이즈 조건 하에서도 이벤트와 LiDAR의 mIoU 값이 높게 유지된다.
  • 추론 분석 결과, 보조 헤드와 MoE 라우팅 메커니즘이 최종 성능 향상에 각각 유의미하고 독립적인 기여를 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.