[논문 리뷰] RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation
이 논문은 RefSAM을 제안하며, 이는 언어-시각 모odal 간의 제로샷, 엔드 투 엔드 정렬이 첫 번째 프레임에서 정답 마스크 없이도 가능한 첫 번째 엔드 투 엔드, SAM 기반의 영상 참조 객체 세분화(RVOS) 프레임워크이다. RefSAM은 경량화된 크로스모달 MLP, 계층적 밀집 어텐션, 암묵적 추적 모듈을 통해 다중모달(비전-언어) 및 시간적(프레임 단위) 정보를 효율적으로 통합함으로써 Segment Anything Model을 적응시킨다. RefSAM은 Ref-Youtube-VOS와 Ref-DAVIS17에서 각각 74.1% mIoU와 72.8% oIoU로 최신 기준 성능을 달성하면서도, ViT-B를 사용할 경우 9.5 FPS의 높은 추론 속도를 유지한다.
The Segment Anything Model (SAM) has gained significant attention for its impressive performance in image segmentation. However, it lacks proficiency in referring video object segmentation (RVOS) due to the need for precise user-interactive prompts and a limited understanding of different modalities, such as language and vision. This paper presents the RefSAM model, which explores the potential of SAM for RVOS by incorporating multi-view information from diverse modalities and successive frames at different timestamps in an online manner. Our proposed approach adapts the original SAM model to enhance cross-modality learning by employing a lightweight Cross-Modal MLP that projects the text embedding of the referring expression into sparse and dense embeddings, serving as user-interactive prompts. Additionally, we have introduced the hierarchical dense attention module to fuse hierarchical visual semantic information with sparse embeddings to obtain fine-grained dense embeddings, and an implicit tracking module to generate a tracking token and provide historical information for the mask decoder. Furthermore, we employ a parameter-efficient tuning strategy to align and fuse the language and vision features effectively. Through comprehensive ablation studies, we demonstrate our model's practical and effective design choices. Extensive experiments conducted on Refer-Youtube-VOS, Ref-DAVIS17, and three referring image segmentation datasets validate the superiority and effectiveness of our RefSAM model over existing methods.
연구 동기 및 목표
- 첫 번째 프레임에서 정답 마스크 없이 언어와 시각 모달 간의 제로샷, 엔드 투 엔드 정렬이 필요한 영상 참조 객체 세분화(RVOS)에 대해 Segment Anything Model(SAM)을 적응시키는 도전 과제를 해결하기 위해.
- 기존의 SAM 기반 방법들이 첫 번째 프레임의 바운딩 박스를 위해 외부 객체 검출기(예: Grounding DINO)에 의존함으로써 파이프라인 오류가 발생하고 엔드 투 엔드 능력이 저하되는 한계를 극복하기 위해.
- 파rameter 효율적인 방식으로 계층적 시각 특징과 희소한 텍스트 유도 프롬프트를 융합하여 영상에서 언어와 시각 간의 효과적인 크로스모달 이해를 가능하게 하기 위해.
- 고성능을 달성하면서도 높은 추론 속도를 유지하는 경량적이고 효율적인 아키텍처를 설계하기 위해.
제안 방법
- 텍스트 임베딩을 T5-3b 인코더에서 추출하여 희소하고 밀집된 프롬프트로 변환하는 경량 크로스모달 MLP를 도입하여, 전통적인 포인트/바운딩 박스 프롬프트를 언어 유도 세분화에 대체한다.
- 다중 스케일 시각 특징과 희소한 텍스트 유도 임베딩을 융합하여 정밀한 밀집 임베딩을 생성하는 계층적 밀집 어텐션 모듈을 제안한다.
- 이전 프레임의 마스크 예측에서 트랙 토큰을 생성하여 마스크 디코더에 역사적 맥락을 제공함으로써 시간적 일관성을 확보하는 암묵적 추적 모듈을 설계한다.
- 소수의 파라미터만을 튜닝하는 파rameter 효율적 튜닝 전략(예: LoRA 스타일 적응)을 적용하여 SAM의 일반화 능력을 유지하면서도 크로스모달 정렬을 가능하게 한다.
- 원본 SAM 아키텍처를 수정하여 프롬프트 인코더와 마스크 디코더가 온라인, 프레임 단위 추론 환경에서 시각적 임베딩과 언어 임베딩을 모두 수용하도록 한다.
- ViT 기반의 시각 인코더(ViT-B/L/H)와 T5-3b 텍스트 인코더를 사용하며, 영상 및 참조 이미지 세분화 데이터셋에서의 공동 학습을 통해 제로샷 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1외부 객체 검출기를 사용하지 않고 첫 번째 프레임에서 정답 마스크가 없더라도, Segment Anything Model(SAM)을 참조 영상 객체 세분화(RVOS)에 효과적으로 엔드 투 엔드로 제로샷 방식으로 적응시킬 수 있는가?
- RQ2첫 번째 프레임에서 정답 마스크가 없을 경우, 언어와 시각 특징 간의 크로스모달 정렬을 어떻게 향상시킬 수 있는가?
- RQ3다중 스케일 시각 특징과 언어 유도 희소 프롬프트를 융합하여 마스크 정확도를 향상시키는 데 가장 효과적인 아키텍처 구성 요소는 무엇인가?
- RQ4암묵적 추적 메커니즘이 온라인 세분화 환경에서 프레임 간 시간적 일관성을 향상시키고 오차 누적을 줄이는 데 기여하는가?
- RQ5파rameter 효율적 튜닝이 SAM의 일반화 능력을 유지하면서도 RVOS에 효과적으로 적응시키는 데 얼마나 기여하는가?
주요 결과
- RefSAM은 Ref-Youtube-VOS에서 74.1% mIoU, Ref-DAVIS17에서 72.8% oIoU를 기록하여 양 대안에서 최신 기준 성능을 달성한다.
- 참조 이미지 세분화 데이터셋(RefCOCO, RefCOCO+, G-Ref)에서 RefSAM은 RefCOCO에서 76.77% mIoU, G-Ref에서 70.14%를 기록하여 LAVT 및 RefTR와 같은 이전 방법들을 능가한다.
- ViT-B 백본을 사용할 경우 RefSAM은 9.5 FPS의 추론 속도를 기록하여 SAM-Track(1.5 FPS)와 PerSAM(4.0 FPS)를 능가하며, 강화된 기능에도 불구하고 높은 효율성을 입증한다.
- 제거 실험 결과, 계층적 밀집 어텐션과 암묵적 추적 모듈이 성능 향상에 각각 크게 기여하며, 크로스모달 MLP는 효과적인 언어 프롬프팅을 위해 필수적임을 확인한다.
- ViT-H를 사용할 경우 RefSAM은 기존 SAM(641.1M)의 일부분에 불과한 6.7M 파라미터만을 사용하며, 파rameter 효율적 튜닝 덕분에 이는 효율성과 확장성의 증거가 된다.
- 모델는 참조 이미지 세분화 작업으로도 잘 일반화되어 세 가지 표준 데이터셋에서 최신 기준 성능을 달성하며, 영상 외적 응용 가능성까지 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.