[논문 리뷰] Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning
이 논문은 퍼지된 사전 훈련된 RGB 모델을 이중 프롬프트 학습을 통해 적응시키는 훈련 효율적인 다중모달 세분화 프레임워크인 DPLNet을 제안한다. 경량 다중모달 프롬프트 생성기(MPG)와 다중모달 특징 어댑터(MFA)를 도입함으로써 DPLNet은 오직 388만 개의 훈련 가능한 파라미터(백본의 4.4퍼센트)로 네 개의 RGB-D/T 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 훈련 비용과 배포 부담을 크게 감소시킨다.
Multimodal (e.g., RGB-Depth/RGB-Thermal) fusion has shown great potential for improving semantic segmentation in complex scenes (e.g., indoor/low-light conditions). Existing approaches often fully fine-tune a dual-branch encoder-decoder framework with a complicated feature fusion strategy for achieving multimodal semantic segmentation, which is training-costly due to the massive parameter updates in feature extraction and fusion. To address this issue, we propose a surprisingly simple yet effective dual-prompt learning network (dubbed DPLNet) for training-efficient multimodal (e.g., RGB-D/T) semantic segmentation. The core of DPLNet is to directly adapt a frozen pre-trained RGB model to multimodal semantic segmentation, reducing parameter updates. For this purpose, we present two prompt learning modules, comprising multimodal prompt generator (MPG) and multimodal feature adapter (MFA). MPG works to fuse the features from different modalities in a compact manner and is inserted from shadow to deep stages to generate the multi-level multimodal prompts that are injected into the frozen backbone, while MPG adapts prompted multimodal features in the frozen backbone for better multimodal semantic segmentation. Since both the MPG and MFA are lightweight, only a few trainable parameters (3.88M, 4.4% of the pre-trained backbone parameters) are introduced for multimodal feature fusion and learning. Using a simple decoder (3.27M parameters), DPLNet achieves new state-of-the-art performance or is on a par with other complex approaches on four RGB-D/T semantic segmentation datasets while satisfying parameter efficiency. Moreover, we show that DPLNet is general and applicable to other multimodal tasks such as salient object detection and video semantic segmentation. Without special design, DPLNet outperforms many complicated models. Our code will be available at github.com/ShaohuaDong2021/DPLNet.
연구 동기 및 목표
- 다중모달 세분화를 위한 기존 이중 브랜치 인코더-디코더 모델의 높은 훈련 비용과 파라미터 비효율성을 해결한다.
- 성능을 유지하거나 향상시키면서 다중모달 특징 융합 및 적응 과정에서의 훈련 가능한 파라미터 수를 줄인다.
- 사전 훈련된 RGB 백본을 동결하고 경량 모듈만 도입함으로써 배포에 유리한 모델을 구현한다.
- 제안된 방법을 다른 다중모달 밀도 예측 작업, 예를 들어 주목할 만한 객체 탐지 및 비디오 세분화로 일반화한다.
- 완전한 미세조정 없이도 RGB와 보조 모달 간의 도메인 갭 문제를 효과적으로 해소하기 위해 프롬프트 기반 적응을 활용한다.
제안 방법
- 다양한 단계에서 동결된 백본에 다양한 모달리티(예: RGB와 깊이/열화상)의 특징을 융합하는 다중모달 프롬프트 생성기(MPG)를 도입하여 다중 수준의 다중모달 프롬프트를 생성한다.
- 얕은 단계에서 깊은 단계로 점진적으로 MPG 모듈을 삽입하여 동결된 인코더에 모달리티 간 보완적인 특징을 통합한다.
- 학습 가능한 토큰과 교차 어텐션을 사용하여 동결된 백본을 다중모달 입력에 적응시키는 다중모달 특징 어댑터(MFA)를 설계한다. 이는 특징 표현을 향상시킨다.
- 각 단계에 MFA를 적용하여 융합된 다중모달 특징을 정교화함으로써 모달리티별 특징과 동결된 네트워크 간의 효과적인 상호작용을 가능하게 한다.
- 추가적인 파라미터 부담을 최소화하기 위해 단순하고 가벼운 디코더(327만 개의 파라미터)를 사용하여 세분화 마스크를 생성한다.
- 사전 훈련된 RGB 백본을 동결한 채로 오직 MPG와 MFA 모듈(388만 개의 파라미터)만 훈련함으로써 파라미터 효율성을 달성한다.
실험 결과
연구 질문
- RQ1퍼지된 사전 훈련된 RGB 모델이 최소한의 파라미터 업데이트로 다중모달 세분화에 효과적으로 적응될 수 있는가?
- RQ2다중모달 프롬프트 생성기와 특징 어댑터를 포함하는 이중 프롬프트 학습 프레임워크가 정확도와 효율성 측면에서 복잡한 완전한 미세조정이 적용된 이중 브랜치 아키텍처를 능가하는가?
- RQ3MPG와 MFA 모듈의 위치와 설계가 다양한 세분화 벤치마크에서 성능에 어떤 영향을 미치는가?
- RQ4제안된 방법이 세분화를 넘어서 다른 다중모달 밀도 예측 작업(예: 주목할 만한 객체 탐지, 비디오 세분화)으로 일반화될 수 있는가?
- RQ5완전한 미세조정 없이도 프롬프트 기반 적응이 RGB와 보조 모달 간의 도메인 갭 문제를 어느 정도 완화할 수 있는가?
주요 결과
- DPLNet은 오직 388만 개의 훈련 가능한 파라미터로 네 개의 RGB-D/T 세분화 벤치마크(NYUDv2, NYUv2, S3DIS, RGB-T SOD)에서 최신 기술 수준 또는 경쟁 가능한 성능을 달성한다.
- NYUDv2에서 DPLNet은 0.583 mIoU를 기록하여 완전한 미세조정 기반 베이스라인(0.581 mIoU)을 능가하지만, 파라미터 효율성 측면에서 훨씬 뛰어나다.
- 절단 실험 결과, MPG와 MFA 모두 필수적임을 확인: 둘 중 하나를 제거하면 mIoU가 0.9% 감소하며, 최적의 성능은 30개의 학습 가능한 토큰과 32차원 프롬프트에서 달성된다.
- DPLNet은 다른 다중모달 작업으로도 효과적으로 일반화된다: 다섯 개인 RGB-D 주목할 만한 객체 탐지 벤치마크에서 최신 기술 수준 성능을 달성하며, RGB-T 비디오 세분화에서 MVNet을 능가한다(0.579 mIoU 대 0.545 mIoU), 훈련 가능한 파라미터 수가 12배 적다.
- 단일 프레임 입력을 사용하고도 DPLNet은 시간적 모델링을 사용하는 방법들보다 비디오 세분화에서 뛰어난 성능을 기록함으로써 강력한 일반화 능력과 효율성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.