Skip to main content
QUICK REVIEW

[논문 리뷰] Referring Image Segmentation Using Text Supervision

Fang Liu, Yuhao Liu|arXiv (Cornell University)|2023. 08. 28.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 픽셀 또는 박스 수준의 애너테이션을 필요로 하지 않고 오직 참조 텍스트 기술서만을 사용하여 훈련하는 약한 감독 기반 참조 이미지 세그멘테이션 프레임워크를 제안한다. 국소화를 긍정(정확한) 및 부정(멀리 떨어진) 텍스트 표현 간의 텍스트 분류 작업으로 공식화함으로써, 이 방법은 双방향 프롬프트, 응답맵 校정, 긍정 응답맵 선택을 통해 고품질의 가짜 레이블을 생성하여, 네 가지 벤치마크에서 완전 감독 기반 방법과 경쟁 가능한 성능을 달성한다.

ABSTRACT

Existing Referring Image Segmentation (RIS) methods typically require expensive pixel-level or box-level annotations for supervision. In this paper, we observe that the referring texts used in RIS already provide sufficient information to localize the target object. Hence, we propose a novel weakly-supervised RIS framework to formulate the target localization problem as a classification process to differentiate between positive and negative text expressions. While the referring text expressions for an image are used as positive expressions, the referring text expressions from other images can be used as negative expressions for this image. Our framework has three main novelties. First, we propose a bilateral prompt method to facilitate the classification process, by harmonizing the domain discrepancy between visual and linguistic features. Second, we propose a calibration method to reduce noisy background information and improve the correctness of the response maps for target object localization. Third, we propose a positive response map selection strategy to generate high-quality pseudo-labels from the enhanced response maps, for training a segmentation network for RIS inference. For evaluation, we propose a new metric to measure localization accuracy. Experiments on four benchmarks show that our framework achieves promising performances to existing fully-supervised RIS methods while outperforming state-of-the-art weakly-supervised methods adapted from related areas. Code is available at https://github.com/fawnliu/TRIS.

연구 동기 및 목표

  • 완전 감독 기반 참조 이미지 세그멘테이션(RIS)의 높은 애너테이션 비용 문제를 해결하기 위해 픽셀 또는 박스 수준의 애너테이션을 제거하는 것.
  • 기존의 참조 텍스트 기술서를 유일한 감독 신호로 사용하여 RIS 모델을 훈련시키는 것.
  • 배경 노이즈를 줄이고 응답맵 품질을 향상시켜 약한 감독 기반 RIS의 국소화 정확도를 향상시키는 것.
  • 기존의 포인팅 게임 메트릭보다 상자 내 오차를 줄이는 새로운 평가 지표를 개발하는 것.
  • 추가 애너테이션이 없이도 오직 텍스트 표현만을 감독으로 사용하여 고품질의 세그멘테이션을 달성할 수 있음을 입증하는 것.

제안 방법

  • RIS를 이진 분류 작업으로 공식화: 목표 객체를 기술하는 참조 텍스트(긍정)와 다른 이미지의 객체를 기술하는 텍스트(부정)를 구분하는 것.
  • 비디오 및 언어적 특징을 보다 잘 정렬하기 위해 양방향 프롬프트 방법을 도입하여 양 모odal 스트림에 프롬프트를 적용함으로써 도메인 차이를 줄이는 것.
  • 학습 가능한 어텐션 메커니즘을 사용하여 응답맵에서 전경 반응을 강화하고 배경 노이즈를 억제하는 보정 방법을 제안하는 것.
  • 동일한 객체를 기술하는 다수의 쿼리에서 가장 구분력 있는 응답맵을 선택하는 긍정 응답맵 선택(Positive Response Map Selection, PRMS) 전략을 설계하여 고품질의 가짜 레이블을 생성하는 것.
  • 선택된 가짜 레이블을 사용해 이중 단계 파이프라인으로 세그멘테이션 네트워크를 훈련하는 것: 먼저 응답맵을 생성하고, 그 다음 세그멘테이션 예측을 보정하는 것.
  • 예측된 응답점과 진짜 응답점 간의 거리를 측정하여 상자 내 오차를 줄이는 새로운 국소화 메트릭(PointM)을 활용하는 것.

실험 결과

연구 질문

  • RQ1오직 텍스트 기술서만을 감독으로 사용하여 참조 이미지 세그멘테이션을 효과적으로 훈련시킬 수 있는가? 추가 애너테이션이 없이도 가능한가?
  • RQ2모델은 이미지 간 참조 텍스트 비교를 어떻게 활용하여 국소화의 강건성과 거짓 긍정을 줄일 수 있는가?
  • RQ3응답맵 보정과 긍정 맵 선택 전략이 가짜 레이블 품질과 최종 세그멘테이션 성능에 얼마나 기여하는가?
  • RQ4제안된 PointM 메트릭은 기존의 포인팅 게임 메트릭에 비해 국소화 정확도 평가를 어떻게 더 정확하게 하는가?
  • RQ5모델 성능과 일반화 능력의 균형을 고려할 때 최적의 부정 쿼리 수와 보정 모듈의 파라미터는 얼마인가?

주요 결과

  • 제안된 방법은 네 가지 RIS 벤치마크에서 기존의 최고 성능을 내는 완전 감독 기반 방법과 경쟁 가능한 성능을 달성하였으며, 오직 텍스트 감독만을 사용하여 훈련된 점에서 놀라운 성과를 보였다.
  • RefCOCO+ 벤치마크에서 24.48%의 IoU를 기록하여, 긍정 응답맵 선택 기능이 없는 기준 모델(22.31%) 대비 2.17%p의 절대적 향상을 보였다.
  • 어려운 RefCOCO+ 데이터셋에서 긍정 응답맵 선택(_PRMS_) 전략이 IoU를 약 10% 향상시켜 최적의 응답맵을 선택하는 데 효과적임을 입증하였다.
  • 보정 모듈에서 48개의 부정 쿼리와 K=6을 사용할 경우 성능이 가장 우수했으며, 과도한 부정 샘플로 인한 클래스 불균형으로 인해 성능 저하가 발생함을 확인하였다.
  • 새로운 PointM 메트릭은 기존의 표준 포인팅 게임 메트릭 대비 상자 내 오차를 줄여 국소화 정밀도 평가를 더 정확하게 제공하였다.
  • 실패 케이스는 유사 의미의 배경 객체나 가림을 받은 타깃을 처리하는 데 한계를 드러내었으며, 향후에는 구조화된 언어적 추론 기반 접근이 가능할 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.