[논문 리뷰] OV-PARTS: Towards Open-Vocabulary Part Segmentation
이 논문은 복잡한 경계, 제한된 애너테이션, 개방형 분류 수준과 같은 문제를 해결하기 위한 오픈 뷰어 부분 분할을 위한 OV-PARTS 벤치마크를 소개한다. 일반화된 제로샷, 크로스데이터셋, 소수 샘플 분할의 세 가지 과제를 제안하며, CLIP 기반 프롬프팅과 미세조정을 활용한 개선된 이단계 및 일단계 베이스라인을 제시하여 청소된 Pascal-Part-116 및 ADE20K-Part-234 데이터셋에서 최신 기술 성능을 달성하며 강력한 제로샷 및 소수 샘플 일반화 성능을 보였다.
Segmenting and recognizing diverse object parts is a crucial ability in applications spanning various computer vision and robotic tasks. While significant progress has been made in object-level Open-Vocabulary Semantic Segmentation (OVSS), i.e., segmenting objects with arbitrary text, the corresponding part-level research poses additional challenges. Firstly, part segmentation inherently involves intricate boundaries, while limited annotated data compounds the challenge. Secondly, part segmentation introduces an open granularity challenge due to the diverse and often ambiguous definitions of parts in the open world. Furthermore, the large-scale vision and language models, which play a key role in the open vocabulary setting, struggle to recognize parts as effectively as objects. To comprehensively investigate and tackle these challenges, we propose an Open-Vocabulary Part Segmentation (OV-PARTS) benchmark. OV-PARTS includes refined versions of two publicly available datasets: Pascal-Part-116 and ADE20K-Part-234. And it covers three specific tasks: Generalized Zero-Shot Part Segmentation, Cross-Dataset Part Segmentation, and Few-Shot Part Segmentation, providing insights into analogical reasoning, open granularity and few-shot adapting abilities of models. Moreover, we analyze and adapt two prevailing paradigms of existing object-level OVSS methods for OV-PARTS. Extensive experimental analysis is conducted to inspire future research in leveraging foundational models for OV-PARTS. The code and dataset are available at https://github.com/OpenRobotLab/OV_PARTS.
연구 동기 및 목표
- 복잡한 경계, 제한된 애너테이션, 개방형 분류 수준 등의 과제를 안고 있는 오픈 뷰어 부분 분할을 위한 표준화된 벤치마크의 부족을 해결하기 위해.
- 시각-언어 모델의 유사성 추론, 개방형 분류 수준, 소수 샘플 적응 능력을 부분 수준 분할에서 조사하기 위해.
- CLIP과 같은 기초 모델의 객체 중심 사전 훈련으로 인해 부분 수준 인식으로의 전이성이 저해되는 문제를 해결하기 위해.
- 표준화된 평가를 가능하게 하고 향후 연구를 자극하기 위해 정련된 데이터셋(Pascal-Part-116 및 ADE20K-Part-234)을 포함한 통합 벤치마크를 제공하기 위해.
제안 방법
- 청소 및 재정리된 Pascal-Part 및 ADE20K-Part 기반의 새로운 벤치마크인 OV-PARTS를 제안하며, 각각 116개 및 234개의 부분 카테고리가 포함되어 있다.
- 세 가지 평가 과제를 도입: 일반화된 제로샷 부분 분할, 크로스데이터셋 부분 분할, 소수 샘플 부분 분할로 모델의 일반화 능력을 평가한다.
- 객체 수준 OVSS의 이단계 및 일단계 파라디그마를 변형 적용: 이단계 접근법은 클래스 무관 마스크 제안을 수행한 후, 객체 인식 및 복합 프롬프팅을 활용한 CLIP 기반 분류를 수행한다.
- 객체 막대 프롬프팅(Object Mask Prompting)을 도입하여 제안 단계에 객체 맥락을 통합하고, 복합 프롬프팅 튜닝(Compositional Prompt Tuning)을 통해 CLIP의 주의를 객체에서 부분으로 이동시킨다.
- 프롬프팅 튜닝을 위해 시각 어댑터(Visual Adapter, VA), 언어 어댑터(Language Adapter, L), FiLM(F)을 사용하며, CLIPSeg의 다양한 구성 요소(예: VA+L+F+D)의 미세조정에 대한 분석 실험을 수행한다.
- 주요 평가 지표로는 알려진 클래스와 알려지지 않은 클래스의 mIoU의 조화 평균을 사용하며, 객체-부분 혼동에 대한 강건성 평가를 위해 Oracle-Obj 및 Pred-Obj 설정을 도입한다.
실험 결과
연구 질문
- RQ1모델는 제로샷 설정에서 유사성 추론을 통해 기존에 본 객체 카테고리에서 볼 수 없는 객체 카테고리로 부분 분할을 얼마나 잘 일반화할 수 있는가?
- RQ2다른 부분 어휘와 분류 수준을 가진 데이터셋 간에 부분 분할 지식을 전이할 때 모델의 성능은 어떻게 되는가?
- RQ3기초 모델을 소수의 애너테이션 예시만으로 부분 분할에 적응시킬 수 있는 정도는 어느 정도이며, 어떤 미세조정 전략이 가장 효과적인가?
- RQ4다양한 프롬프팅 튜닝 전략(예: 객체 인식, 복합적)은 CLIP의 객체보다 부분을 인식하는 데 얼마나 기여하는가?
- RQ5오픈 뷰어 부분 분할에서 CLIPSeg의 다양한 구성 요소를 미세조정할 때 성능 상충과 실패 모드는 어떠한가?
주요 결과
- VA+L+F+D 미세조정된 CLIPSeg 모델은 소수 샘플 설정에서 Pascal-Part-116에서 35.04%의 조화 평균 mIoU, ADE20K-Part-234에서는 33.13%를 기록하여 다른 분석 조합보다 뛰어난 성능을 보였다.
- 시각 어댑터 미세조정(VA+F)은 Pascal-Part-116에서는 성능 향상을 보였지만, ADE20K-Part-234에서는 성능이 열 劣하므로 데이터셋 별 전이성 격차가 있음을 시사했다.
- 디코더(D)의 미세조정은 ADE20K-Part-234에서 성능 저하를 초래하여 낮은 데이터 환경에서의 과적합 위험이 있음을 시사했다.
- VA+L+F+D 설정은 Oracle-Obj 조건에서는 0.69% 향상되었지만, Pred-Obj 조건에서는 ADE20K-Part-234에서 1.2% 감소하여 객체보다 부분에 대한 편향이 있음을 나타냈다.
- Pred-Obj 설정에서 CATSeg는 더 많은 파arameter를 가짐에도 불구하고 CLIPSeg를 능가하는 크로스데이터셋 분할 성능을 보였으며, 더 낮은 과적합과 더 나은 일반화 능력을 지녔음을 시사했다.
- 정성적 결과에서는 CLIP 기반 모델이 복잡한 부분 기술어와 경계 구분에서 언어 이해 능력에 어려움을 겪는 것으로 나타났으며, 특히 크로스데이터셋 설정에서 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.