Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-supervised segmentation of referring expressions

Robin Strudel, Ivan Laptev|arXiv (Cornell University)|2022. 05. 10.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 픽셀 수준의 애너테이션 없이 이미지 수준의 참조 표현만을 사용하여 분할 마스크를 학습하는 트랜스포머 기반 방법인 TSEG을 소개한다. 다중 레이블 패치 할당 기반으로 텍스트를 시각적 패치에 정렬함으로써 TSEG은 PhraseCut 및 RefCOCO에서 뛰어난 성능을 달성하였으며, Pascal VOC에서의 제로샷 전이 mIoU가 48.5로 나타나 개방형 어휘 분할에 대한 유망한 확장성을 보여주었다.

ABSTRACT

Visual grounding localizes regions (boxes or segments) in the image corresponding to given referring expressions. In this work we address image segmentation from referring expressions, a problem that has so far only been addressed in a fully-supervised setting. A fully-supervised setup, however, requires pixel-wise supervision and is hard to scale given the expense of manual annotation. We therefore introduce a new task of weakly-supervised image segmentation from referring expressions and propose Text grounded semantic SEGgmentation (TSEG) that learns segmentation masks directly from image-level referring expressions without pixel-level annotations. Our transformer-based method computes patch-text similarities and guides the classification objective during training with a new multi-label patch assignment mechanism. The resulting visual grounding model segments image regions corresponding to given natural language expressions. Our approach TSEG demonstrates promising results for weakly-supervised referring expression segmentation on the challenging PhraseCut and RefCOCO datasets. TSEG also shows competitive performance when evaluated in a zero-shot setting for semantic segmentation on Pascal VOC.

연구 동기 및 목표

  • 피크셀 수준의 애너테이션이 비용이 많이 들기 때문에 필요한 완전히 감독된 참조 표현 분할의 확장성 문제를 해결한다.
  • 이미지 수준의 참조 표현만을 감독으로 사용하는 약한 감독 하에 참조 표현 분할의 새로운 작업을 제안한다.
  • 이미지 수준의 레이블이 불완전하고 어휘가 사전에 정의되어 있지 않은 개방형 어휘, 복합적 참조 표현에 대한 약한 감독 분할의 과제를 해결한다.
  • 목표 데이터셋에서의 피지테이닝 없이 제로샷 세그멘테이션에 일반화할 수 있는 방법을 설계한다.

제안 방법

  • 참조 표현 분할을 위한 트랜스포머 기반 아키텍처인 Text grounded semantic SEGgmentation (TSEG)을 제안하며, Segmenter를 확장한다.
  • 패치-텍스트 유사도를 계산하고 여러 텍스트 레이블을 이미지 패치에 할당하는 전역 가중 풀링 기반의 다중 레이블 패치 할당(MPA) 메커니즘을 도입한다.
  • 훈련 중에 패치-텍스트 유사도 점수를 이용해 분류 목표를 안내함으로써, 이미지 수준의 감독에서 종단 간 학습이 가능하도록 한다.
  • 비전 트랜스포머 백본을 사용해 패치 수준의 특징을 추출하고, 텍스트 인코더를 사용해 참조 표현을 처리한다.
  • MPA 최적화된 패치 특징을 기반으로 각 참조 표현에 대해 분할 마스크를 예측하는 다중 레이블 분류 헤드를 적용한다.
  • Pascal VOC 클래스 이름을 텍스트 프롬프트로 인코딩하고 신뢰도 임계값을 사용해 예측 마스크를 선택함으로써 제로샷 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1비전-언어 모델이 픽셀 수준의 감독 없이 오직 이미지 수준의 참조 표현만으로 정확한 분할 마스크를 학습할 수 있는가?
  • RQ2제안된 다중 레이블 패치 할당 기반의 메커니즘이 약한 감독 설정에서 전역 최대 풀링 또는 전역 평균 풀링에 비해 분할 정확도를 얼마나 향상시키는가?
  • RQ3약한 감독 하에 참조 표현 분할에 사전 훈련된 모델이 Pascal VOC와 같은 개방형 어휘 데이터셋에서 제로샷 세그멘테이션에 얼마나 일반화되는가?
  • RQ4의도하지 않은 또는 세밀한 묘사(예: '더 진한 갈색 테디베어')를 다룰 때 약한 감독 하에 참조 표현 분할의 한계는 무엇인가?
  • RQ5레이블 엔지니어링을 통해 'person'과 같은 저조도 클래스에서의 성능 저하를 완화할 수 있는가?

주요 결과

  • TSEG은 픽셀 수준의 애너테이션이 전혀 없이 이미지 수준의 참조 표현만을 사용하여 PhraseCut 테스트 세트에서 44.8 mIoU를 달성했으며, GAP, GMP, SPA와 같은 기존 방법들을 크게 앞서간다.
  • RefCOCO에서 TSEG은 약한 감독 하에 66.00 mIoU를 기록했으며, 이는 이 분할에서 최고의 완전 감독 방법인 VLT를 초월한다.
  • 완전한 감독 하에서 TSEG은 PhraseCut에서 49.6 mIoU를 달성했으며, 더 큰 데이터셋과 고해상도 이미지에서 사전 훈련된 MDETR의 53.1 mIoU에 매우 가까운 성능을 보였다.
  • Pascal VOC 2012에서의 제로샷 평가에서 TSEG은 48.5 mIoU를 기록했으며, SPA 기반 베이스라인(43.5 mIoU)을 능가하여, 새로운 클래스에 대한 강력한 일반화 능력을 보여주었다.
  • 레이블 엔지니어링(예: 'person' 대신 'rider' 또는 'woman' 사용)을 적용함으로써 TSEG의 제로샷 mIoU는 50.3으로 향상되었으며, 3000만 장의 이미지-텍스트 쌍에서 훈련된 GroupViT의 51.2 mIoU에 근접하였다.
  • 'person' 클래스에서의 실패 케이스는 더 구체적인 텍스트 프롬프트가 필요함을 시사하며, 모델의 편향이 훈련 데이터의 애너테이션 패턴에서 부분적으로 기인하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.