[논문 리뷰] SAM Struggles in Concealed Scenes -- Empirical Study on Segment Anything
이 논문은 은폐된 장면—은폐된 동물, 산업 결함, 의료 병변—에서 Segment Anything Model(SAM)의 실험적 평가를 수행하여 최신 기술 모델과 비교해 뚜렷한 성능 격차를 드러낸다. 자연 이미지에서 강력한 일반화 능력을 보이는 것으로 나타났지만, 미세한 의미적 신호를 인지하지 못하고 도메인 특화된 인도크티브 비아스가 부족하여 저대비, 시각적으로 숨겨진 상황에서 의미 이해 능력에 어려움을 겪는다.
Segmenting anything is a ground-breaking step toward artificial general intelligence, and the Segment Anything Model (SAM) greatly fosters the foundation models for computer vision. We could not be more excited to probe the performance traits of SAM. In particular, exploring situations in which SAM does not perform well is interesting. In this report, we choose three concealed scenes, i.e., camouflaged animals, industrial defects, and medical lesions, to evaluate SAM under unprompted settings. Our main observation is that SAM looks unskilled in concealed scenes.
연구 동기 및 목표
- 은폐된 장면 이해 작업에서 Segment Anything Model(SAM)의 성능 한계를 조사하기.
- CAMO, COD10K, NC4K와 같은 표준 은폐된 물체 세분화 벤치마크에서 SAM의 제로샷 일반화 능력을 평가하기.
- 은폐된 시나리오 세 가지—은폐된 동물, 산업 결함, 의료 병변—에서의 실패 케이스를 규명하기.
- 무프롬프트 설정에서 최신 기술 COS 모델과 SAM의 세분화 성능을 정량적으로 비교하기.
- SAM의 인지적 한계를 분석하고 저대비, 의미적으로 모호한 환경에서 기초 모델의 향상을 위한 방향 제안하기.
제안 방법
- 저자들은 예측 마스크와 진짜 마스크 간의 교차율(IoU) 기반 마스크 선택 전략을 사용하여 다수의 SAM 예측 중 최상의 출력을 선별한다.
- 세 가지 표준 은폐된 물체 세분화 벤치마크(CAMO, COD10K, NC4K)에서 정량적 평가를 수행한다.
- 다섯 가지 표준 지표를 사용한다: 구조 측정($S_\alpha$), 향상된 정렬 측정($E_\phi$), F-측정($F_\beta$), 가중 F-측정($F_\beta^w$), 평균 절대 오차($M$).
- 평가 시나리오는 프롬프트 없이 SAM이 다수의 마스크를 생성하고, 가장 높은 IoU를 보이는 마스크를 비교 대상으로 선별하는 방식이다.
- Qualitative 분석은 SAM의 온라인 데모를 활용하여 세 가지 은폐된 시나리오에서의 실패 케이스를 시각화한다.
- 일致한 백본 및 훈련 프로토콜을 사용하여 SAM(ViT-B, ViT-L, ViT-H)을 최신 기술 COS 모델인 CamoFormer-P/S 및 HitNet과 비교한다.
![Figure 1: SAM [ 1 ] fails to perceive the animals that are visually “hidden” in their natural surroundings. All the samples are from COD10K dataset [ 5 ] .](https://ar5iv.labs.arxiv.org/html/2304.06022/assets/x1.png)
실험 결과
연구 질문
- RQ1SAM은 최신 기술 모델과 비교해 은폐된 물체 세분화 벤치마크에서 어떻게 성능을 내는가?
- RQ2SAM은 왜 은폐된 동물, 산업 결함, 의료 병변과 같은 은폐된 물체를 세분화하지 못하는가?
- RQ3저대비, 의미적으로 모호한 장면에서 SAM의 핵심 실패 패턴은 무엇인가?
- RQ4SAM의 모델 스케일을 증가시켜(ViT-B에서 ViT-H로) 은폐된 장면에서 성능이 얼마나 향상되는가?
- RQ5도메인 특화된 인도크티브 비아스나 사전 지식을 통합함으로써 SAM의 성능을 향상시킬 수 있는가?
주요 결과
- ViT-B 기준 CAMO에서 SAM의 가중 F-측정($F_\beta^w$)은 0.353에 불과하며, ViT-H로 확장하면 0.700으로 향상되지만 여전히 최신 기술 모델보다 크게 열등하다.
- COD10K 데이터셋에서 SAM(ViT-H)는 CamoFormer-S보다 $E_\phi^{mx}$ 기준 13.8% 뒤져 있어 향상된 정렬 성능에서 뚜렷한 격차를 보인다.
- CAMO에서 SAM(ViT-H)와 CamoFormer-S 간의 $E_\phi^{mx}$ 격차는 25.6%에 이르며, 은폐된 장면에서의 일반화 능력 부족을 입증한다.
- SAM은 자주 은폐되거나 가림된 물체를 여러 개의 분리된 마스크로 세분화하여 의미적 일관성이 약한 영역에서의 약한 의미적 일관성을 보여준다.
- 의료 영상에서는 종양이나 혈관과 같은 비형상 병변조차도 시각적으로 뚜렷한 경우에도 해부학적 및 병리학적 지식이 부족하여 탐지하지 못한다.
- ViT-H로 확장함에도 불구하고 성능 격차가 지속되며, 이는 데이터 스케일만으로는 SAM의 은폐된 장면에서의 인지 한계를 해결하기에 부족하다는 것을 시사한다.
![Figure 2: SAM [ 1 ] is unskilled in detecting concealed defects in industrial scenes. These samples are taken from KolektorSDD [ 17 ] , MagneticTile [ 18 ] , and MVTecAD [ 19 ] datasets.](https://ar5iv.labs.arxiv.org/html/2304.06022/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.