[논문 리뷰] On the Robustness of Segment Anything
이 논문은 SA-1B 및 KITTI 데이터셋을 기반으로 새로 구축한 벤치마크를 사용하여 Segment Anything Model(SAM)의 적대적 공격과 일반적인 손상 조건 하에서의 테스트 시기 내 성능에 대해 평가한다. 강력한 일반화 능력을 보이지만, PGD 및 BIM 적대적 공격에 매우 취약하며, 블러 관련 손상 이외의 대부분의 손상에는 견고한 편이지만, 자율주행과 같은 안전이 중요한 애플리케이션에서 임계적인 취약점이 드러난다.
Segment anything model (SAM) has presented impressive objectness identification capability with the idea of prompt learning and a new collected large-scale dataset. Given a prompt (e.g., points, bounding boxes, or masks) and an input image, SAM is able to generate valid segment masks for all objects indicated by the prompts, presenting high generalization across diverse scenarios and being a general method for zero-shot transfer to downstream vision tasks. Nevertheless, it remains unclear whether SAM may introduce errors in certain threatening scenarios. Clarifying this is of significant importance for applications that require robustness, such as autonomous vehicles. In this paper, we aim to study the testing-time robustness of SAM under adversarial scenarios and common corruptions. To this end, we first build a testing-time robustness evaluation benchmark for SAM by integrating existing public datasets. Second, we extend representative adversarial attacks against SAM and study the influence of different prompts on robustness. Third, we study the robustness of SAM under diverse corruption types by evaluating SAM on corrupted datasets with different prompts. With experiments conducted on SA-1B and KITTI datasets, we find that SAM exhibits remarkable robustness against various corruptions, except for blur-related corruption. Furthermore, SAM remains susceptible to adversarial attacks, particularly when subjected to PGD and BIM attacks. We think such a comprehensive study could highlight the importance of the robustness issues of SAM and trigger a series of new tasks for SAM as well as downstream vision tasks.
연구 동기 및 목표
- 테스트 시기 내 적대적 상황과 일반적인 손상 조건 하에서 Segment Anything Model(SAM)의 성능에 대해 연구한다.
- 공개 데이터셋(SA-1B 및 KITTI)을 통합하여 성능 테스트를 위한 종합적인 평가 벤치마크를 구축한다.
- 다양한 프롬프트 유형(점, 바운딩 박스, 마스크)이 손상 및 적대적 조건 하에서 SAM의 성능에 어떤 영향을 미치는지 분석한다.
- 특히 자율주행 환경에서의 이상치 분포(OOD) 설정에서 소형 및 대형 객체에 대해 SAM의 성능를 별도로 평가한다.
- 분류 기반 방법을 초월하여 분할 전용 적대적 공격(예: SegPGD)을 확장하여 보다 현실적인 평가를 수행한다.
제안 방법
- SA-1B 및 KITTI 데이터셋을 통합하여 내분포(IID) 및 이상치 분포(OOD) 평가를 위한 테스트 시기 내 성능 평가 벤치마크를 구축하였다.
- 분할 작업에 특화된 적대적 공격 방법(FGSM, PGD, BIM, SegPGD)을 확장하여 인간이 설계한 변형 조건 하에서의 성능에 대해 평가하였다.
- ImageNet-C 및 KITTI-C 데이터셋을 사용하여 15종의 일반적인 손상 조건(Gaussian noise, blur, fog, snow 등)에 대해 다섯 단계의 심각도 수준에서 평가하였다.
- KITTI에서 객체 크기(소형 vs. 대형)에 대한 분석을 위해 아블레이션 스터디를 수행하여 다양한 객체 크기 간 성능 차이를 분석하였다.
- 전경 및 배경 분할 마스크에 대해 주로 평균 교차율(mIoU)을 평가 지표로 사용하였다.
- 창문, 사람, 차량 등의 다양한 객체 유형에서 적대적 및 손상된 결과를 시각화하여 실패 모드를 정성적으로 평가하였다.
실험 결과
연구 질문
- RQ1SAM은 다양한 일반적인 손상 조건 하에서 어떻게 성능을 보이며, 어떤 손상 조건이 분할 정확도를 가장 심각하게 떨어뜨리는가?
- RQ2특히 인스턴스 분할 맥락에서 SAM은 PGD 및 BIM 공격에 얼마나 취약한가?
- RQ3프롬프트 유형(예: 점, 바운딩 박스, 마스크)은 적대적 및 손상 조건 하에서 SAM의 성능에 어떤 영향을 미치는가?
- RQ4실제 이상치 분포 상황(예: 자율주행)에서 소형 및 대형 객체 간 SAM의 성능에 뚜렷한 차이가 존재하는가?
- RQ5분할 전용 적대적 공격(예: SegPGD)은 분류 기반 공격보다 SAM에서 더 심각한 실패를 유도하는가?
주요 결과
- SAM은 Gaussian noise, shot noise, impulse noise, 안개, 눈, 밝기/대trast 변화 등의 대부분의 일반적인 손상에 대해 놀라운 견고성을 보이며, 청소년 및 중간 수준의 손상 입력에서 mIoU 값이 0.99 이상을 기록한다.
- 블러 관련 손상—특히 초점 불일치 블러, 유리 흐림 블러, 줌 블러—는 SAM의 성능을 심각하게 떨어뜨리며, 심도 수준 5에서 전경 mIoU가 0.3 이하로 떨어진다.
- SAM은 PGD 및 BIM 적대적 공격에 매우 취약하며, KITTI의 소형 객체에서 PGD 공격 시 전경 mIoU가 최소 0.2626까지 떨어진다.
- SegPGD 공격은 마스크 수축을 유도하는 반면, PGD 및 BIM 공격은 일반적으로 원래 객체 경계를 초과하는 과도한 분할을 유도한다.
- KITTI의 소형 객체에서는 적대적 공격(PGD, BIM, SegPGD)으로 인해 성능 저하가 심각하며, 심도 수준 5에서 전경 mIoU가 0.3 이하로 떨어진다.
- 대부분의 손상에 대해 견고성을 보이지만, 블러 및 적대적 공격에 의한 성능 저하는 자율주행 차량과 같은 안전이 중요한 애플리케이션에서 임계적인 취약점을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.