Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Open-Vocabulary Image Segmentation with Image-Level Labels

Golnaz Ghiasi, Xiuye Gu|arXiv (Cornell University)|2021. 12. 22.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

OpenSeg는 이미지 수준의 캡션을 사용하여 임의의 텍스트 쿼리에 대해 분할할 수 있는 확장 가능한 오픈 어휘 이미지 분할 프레임워크를 제안한다. 모델은 먼저 클래스에 관계없이 분할 마스크를 예측한 후, 영역 수준의 특징을 통해 캡션의 단어를 이 마스크에 정렬한다. 이로 인해 LSeg 대비 PASCAL VOC에서 19.9 mIoU 향상을 달성한다. 이는 약한 지도 학습 기반의 대규모 캡션 데이터를 활용한 결과이다.

ABSTRACT

We design an open-vocabulary image segmentation model to organize an image into meaningful regions indicated by arbitrary texts. Recent works (CLIP and ALIGN), despite attaining impressive open-vocabulary classification accuracy with image-level caption labels, are unable to segment visual concepts with pixels. We argue that these models miss an important step of visual grouping, which organizes pixels into groups before learning visual-semantic alignments. We propose OpenSeg to address the above issue while still making use of scalable image-level supervision of captions. First, it learns to propose segmentation masks for possible organizations. Then it learns visual-semantic alignments by aligning each word in a caption to one or a few predicted masks. We find the mask representations are the key to support learning image segmentation from captions, making it possible to scale up the dataset and vocabulary sizes. OpenSeg significantly outperforms the recent open-vocabulary method of LSeg by +19.9 mIoU on PASCAL dataset, thanks to its scalability.

연구 동기 및 목표

  • 폐쇄 집합 카테고리 외의 임의의 텍스트 쿼리에 대해 이미지 분할을 가능하게 하기 위해.
  • CLIP 및 ALIGN과 같은 비전-언어 모델이 단일 이미지 특징 표현 방식으로 인해 픽셀 수준의 국소화 기능이 부족한 점을 보완하기 위해.
  • 비용이 많이 드는 픽셀 수준의 애너테이션 대신 약한 지도 학습 기반의 이미지 수준 캡션을 활용하여 학습 데이터와 어휘 크기를 확장하기 위해.
  • 중위의 시각적 군집화 이후에 시각-언어 정렬을 학습함으로써 국소화 정확도를 향상시키기 위해.
  • 언어를 통일된 인터페이스로 사용하여 데이터셋 간 제로샷 전이 성능을 가능하게 하기 위해.

제안 방법

  • 모델은 영역-이미지 간 크로스 어텐션을 사용하는 클래스에 관계없는 분할 헤드를 활용하여 후보 분할 마스크의 집합을 예측한다.
  • 예측된 각 마스크 내의 픽셀에서 특징 풀링을 수행하여 위치 인식 영역 특징을 생성한다.
  • 비디오 특징과 단어 특징 간의 대비 손실을 사용하여 캡션의 단어를 예측된 마스크에 매칭함으로써 시각-언어 정렬을 학습한다.
  • 사전 학습된 CLIP/ALIGN 텍스트 인코더를 활용하고, 더 나은 초기화를 위해 대규모 ALIGN 체크포인트에서 시각 백본을 초기화한다.
  • 캡션에 대해 텍스트 필터링을 적용하여 노이즈를 줄이기 위해 명사와 형용사만 유지한다.
  • 추론 과정에서 예측된 마스크를 제안서로 사용하여 특징 맵과 단어 특징 간의 내적 곱을 통해 픽셀 단위 분할을 유도한다.

실험 결과

연구 질문

  • RQ1픽셀 수준의 애너테이션 대신 이미지 수준의 캡션에서 시각-언어 정렬을 오픈 어휘 분할을 위해 효과적으로 학습할 수 있는가?
  • RQ2마스크 제안을 통해 중위의 시각적 군집화 이후에 시각-언어 정렬을 학습하는 것이 전반적인 이미지 특징에 대한 엔드 투 엔드 정렬 대비 국소화 정확도를 향상시키는가?
  • RQ3이미지 캡션을 통한 약한 지도 학습의 확장성은 성능과 다양한 데이터셋 간 일반화에 어떤 영향을 미치는가?
  • RQ4텍스트 필터링(예: 명사와 형용사만 유지)은 모델의 강건성과 성능에 어떤 영향을 미치는가?
  • RQ5대규모 약한 지도 학습 데이터에서 학습된 모델이 보류된 분할 벤치마크에서 강력한 제로샷 전이 성능을 달성할 수 있는가?

주요 결과

  • OpenSeg는 PASCAL VOC 데이터셋에서 가장 강력한 LSeg 모델 대비 19.9 mIoU 향상을 달성하여 뛰어난 제로샷 일반화 성능을 입증하였다.
  • 사전 학습된 ALIGN 시각 인코더를 초기화에 사용할 경우 랜덤 또는 NoisyStudent 초기화보다 더 좋은 성능을 기록하였지만, 격차는 작았다.
  • 마스크 제안 없이 추론을 수행할 경우 PC-59에서 mIoU가 10.0 포인트 감소하여, 마스크 제안이 정확한 국소화에 필수적임을 시사한다.
  • 정답 마스크를 제안서로 사용할 경우 PC-59에서 mIoU가 49.3으로 상승하여 현재의 마스크 예측 성능이 최적화되지 않았고 핵심 성능 저하 요인임을 나타낸다.
  • 캡션을 명사와 형용사로만 필터링할 경우 가장 높은 성능을 기록하였으며, 모든 단어를 사용한 경우 대비 최대 1.1 포인트의 mIoU 향상이 있었다.
  • 모델는 보류된 데이터셋으로의 일반화 성능이 뛰어나며, 언어를 통일된 인터페이스로 사용하여 일반화 분할 모델을 훈련하는 것이 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.