Skip to main content
QUICK REVIEW

[논문 리뷰] MMNet: Multi-Mask Network for Referring Image Segmentation

Yichen Yan, Xingjian He|arXiv (Cornell University)|2023. 05. 24.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

MMNet는 참조 표현의 다양한 해석에 대응하는 다중 마스크를 생성하기 위해 CLIP의 전역적이고 세밀한 특징을 활용하는 멀티마스크 네트워크를 제안한다. 이로 인해 모호성을 감소시키고, 후처리 없이 RefCOCO, RefCOCO+, G-Ref에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Referring image segmentation aims to segment an object referred to by natural language expression from an image. However, this task is challenging due to the distinct data properties between text and image, and the randomness introduced by diverse objects and unrestricted language expression. Most of previous work focus on improving cross-modal feature fusion while not fully addressing the inherent uncertainty caused by diverse objects and unrestricted language. To tackle these problems, we propose an end-to-end Multi-Mask Network for referring image segmentation(MMNet). we first combine picture and language and then employ an attention mechanism to generate multiple queries that represent different aspects of the language expression. We then utilize these queries to produce a series of corresponding segmentation masks, assigning a score to each mask that reflects its importance. The final result is obtained through the weighted sum of all masks, which greatly reduces the randomness of the language expression. Our proposed framework demonstrates superior performance compared to state-of-the-art approaches on the two most commonly used datasets, RefCOCO, RefCOCO+ and G-Ref, without the need for any post-processing. This further validates the efficacy of our proposed framework.

연구 동기 및 목표

  • 다양한 객체와 제약 없는 언어 표현으로 인해 발생하는 참조 이미지 세그멘테이션의 본질적 난수성 문제를 해결하기 위해.
  • 이전 방법들이 단일 특징 융합에 의존하고 언어의 의미적 모호성을 모델링하지 못하는 한계를 극복하기 위해.
  • CLIP의 사전 훈련된 시각-언어 표현을 활용하여 다중 모odal 간 정렬성과 특징의 풍부함을 향상시키기 위해.
  • 각기 다른 언어 쿼리 해석에 대응하는 다중 마스크를 생성하고 융합함으로써 세그멘테이션의 견고성을 향상시키기 위해.
  • 후처리 없이 표준 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • CLIP을 활용해 이미지 표현을 향상시키기 위해 전역 시각적 특징($f_{vg}$)과 세밀한 시각적 특징($f_{vd}$)을 추출한다.
  • 멀티쿼리 추정기($f_{vg}$)를 사용해 언어 표현으로부터 다수의 쿼리를 생성하며, 각 쿼리는 텍스트의 다른 의미적 측면을 포괄한다.
  • 각 쿼리에 대해 멀티마스크 프로젝터를 통해 해당하는 세그멘테이션 마스크를 생성함으로써 동일한 표현에 대한 다양한 해석을 가능하게 한다.
  • 유연한 어텐션 메커니즘을 통해 각 마스크에 점수를 할당하여 그 관련성과 신뢰도를 반영한다.
  • 점수에 따라 각 마스크의 기여도를 결정하는 가중치 합을 통해 모든 마스크를 융합한다.
  • 정답 마스크에 대한 교차 엔트로피 손실을 사용해 전체 네트워크를 엔드 투 엔드로 훈련하며, 후처리가 필요 없다.

실험 결과

연구 질문

  • RQ1참조 표현의 다양한 해석으로부터 다수의 마스크를 생성함으로써 모호성을 줄이고 세그멘테이션 정확도를 향상시킬 수 있는가?
  • RQ2CLIP의 전역적 및 세밀한 시각적 특징 추출 기법이 참조 이미지 세그멘테이션 향상에 얼마나 효과적인가?
  • RQ3다수의 마스크를 가중치 합으로 융합하는 방식이 언어의 난수성 문제를 다루는 데 단일 마스크 생성 방식보다 더 우수한가?
  • RQ4멀티쿼리 추정기 및 멀티마스크 프로젝터 컴포넌트가 전체 성능에 기여하는 정도는 어떠한가?
  • RQ5제안된 방법이 후처리 없이 표준 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • MMNet는 RefCOCO+ testA에서 68.14 IoU를 기록하여 후처리 없이도 이전 최신 기술 수준의 방법들을 능가한다.
  • 제거 실험 결과, 멀티쿼리 추정기를 제거하면 성능이 1.23 점 감소하여, 마스크 가중치에 있어 그 중요성을 확인한다.
  • 전역 시각적 특징($f_{vg}$)을 제거할 경우 IoU가 1.23점 하락하여, CLIP의 전역 표현이 핵심적인 역할을 한다는 것을 입증한다.
  • 쿼리 수 $N_q = 24$를 가진 멀티마스크 프로젝터가 가장 우수한 성능을 보이며, 더 높은 쿼리 다양성이 견고성 향상에 기여함을 시사한다.
  • 시각화 결과는 기존 기반 모델들과 달리 MMNet가 모호한 객체(예: 가지치기된 vs. 가지치기되지 않은 샌드위치)를 효과적으로 구분함을 확인한다.
  • 이 방법은 다양한 데이터셋에 대해 잘 일반화되며, RefCOCO, RefCOCO+, G-Ref에서 모두 새로운 최신 기술 수준의 성능을 달성하여 그 효과성과 견고성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.