[논문 리뷰] Towards Robust Referring Image Segmentation
이 논문은 잘못되거나 오해의 소지가 있는 텍스트 설명을 처리할 수 있도록 표준 참조 이미지 세그멘테이션을 확장한 새로운 작업인 강건한 참조 이미지 세그멘테이션(R-RIS)을 소개한다. 이 작업은 존재하지 않는 객체에 대해 빈 마스크를 출력하도록 요구함으로써 모델의 강건성을 향상시킨다. 저자들은 비전-언어 토큰 융합 모듈과 빈 토큰 설계를 갖춘 트랜스포머 기반 모델인 RefSegformer를 제안하여 표준 및 강건한 RIS 벤치마크에서 최신 기술 성능을 달성하였으며, rIoU 및 mRR와 같은 새로운 지표를 도입하였다.
Referring Image Segmentation (RIS) is a fundamental vision-language task that outputs object masks based on text descriptions. Many works have achieved considerable progress for RIS, including different fusion method designs. In this work, we explore an essential question, ``What if the text description is wrong or misleading?'' For example, the described objects are not in the image. We term such a sentence as a negative sentence. However, existing solutions for RIS cannot handle such a setting. To this end, we propose a new formulation of RIS, named Robust Referring Image Segmentation (R-RIS). It considers the negative sentence inputs besides the regular positive text inputs. To facilitate this new task, we create three R-RIS datasets by augmenting existing RIS datasets with negative sentences and propose new metrics to evaluate both types of inputs in a unified manner. Furthermore, we propose a new transformer-based model, called RefSegformer, with a token-based vision and language fusion module. Our design can be easily extended to our R-RIS setting by adding extra blank tokens. Our proposed RefSegformer achieves state-of-the-art results on both RIS and R-RIS datasets, establishing a solid baseline for both settings. Our project page is at \url{https://github.com/jianzongwu/robust-ref-seg}.
연구 동기 및 목표
- 기존 참조 이미지 세그멘테이션(RIS) 모델이 잘못되거나 오해의 소지가 있는 텍스트 설명에 직면했을 때의 취약성을 해결하기 위해.
- 비존재 객체(즉, 존재하지 않는 객체)를 참조하는 표현을 명시적으로 다루는 새로운 작업 정의인 강건한 RIS(R-RIS)를 제안하기 위해.
- 기존 RIS 데이터셋에 다양한 부정 문장을 추가하여 세 개의 새로운 R-RIS 데이터셋을 구축하기 위해.
- 정확도와 강건성을 동시에 평가할 수 있도록 새로운 지표인 강건 IoU(rIoU)와 평균 강건 재현율(mRR)을 설계하고 평가하기 위해.
- 비전-언어 토큰 융합 모듈과 빈 토큰 메커니즘을 갖춘 트랜스포머 기반 모델인 RefSegformer를 개발하여 R-RIS에 대한 강력한 베이스라인을 제공하기 위해.
제안 방법
- 비존재 객체를 참조하는 부정적 입력에 대해 빈 마스크를 출력하고, 존재하는 객체를 참조하는 경우에만 정확한 마스크를 출력하도록 요구하는 새로운 작업 정의인 R-RIS를 제안한다.
- RefCOCO, RefCOCO+, RefCOCOg에 각각 10개의 부정 문장을 추가하여 5가지 생성 방법(임의의 교체, 이름 교체, 대상 객체 변경, 속성 변경, 관계 변경)을 사용해 세 개의 R-RIS 벤치마크를 구축한다.
- 두 가지 평가 지표를 도입한다: 픽셀 수준의 강건성과 정확도를 측정하는 강건 IoU(rIoU), 그리고 부정 입력에 대한 인스턴스 수준의 강건성을 측정하는 평균 강건 재현율(mRR).
- 메모리 토큰을 사용해 관련 언어 특징을 동적으로 선택하는 비전-언어 토큰 융합(VLTF) 모듈을 갖춘 트랜스포머 기반 모델인 RefSegformer를 설계한다.
- 언어 특징과 상호작용하지 않는 빈 토큰을 융합 기반 구조에 통합하여, 존재하는 객체 탐지와 존재하지 않는 객체 식별을 분리시킬 수 있도록 한다.
- 비전 및 언어 특징을 융합하기 위해 다중 헤드 크로스 어텐션(MHCA)을 사용하여 VLTF 모듈을 통해 관련 시각적 및 언어적 표현에 주목할 수 있도록 한다.
실험 결과
연구 질문
- RQ1존재하지 않는 객체를 참조하는 잘못되거나 오해의 소지가 있는 텍스트 설명에 대해 참조 이미지 세그멘테이션 모델이 어떻게 강건성을 확보할 수 있는가?
- RQ2강건한 RIS 모델을 평가하기 위해 효과적인 방법으로 다양한 부정 참조 표현을 생성하는 방법은 무엇인가?
- RQ3정확도와 부정 입력에 대한 강건성을 동시에 측정할 수 있도록 평가 지표를 어떻게 설계할 수 있는가?
- RQ4RefSegformer와 같은 통합 트랜스포머 아키텍처가 표준 RIS와 새로운 R-RIS 작업을 동시에 효과적으로 처리하고 성능을 향상시킬 수 있는가?
- RQ5융합 기반 구조에 빈 토큰을 포함시키는 것이 표준 융합 모듈에 비해 모델의 강건성을 어떻게 향상시키는가?
주요 결과
- RefSegformer는 표준 RIS 및 신규 도입된 R-RIS 벤치마크를 포함한 여섯 개의 데이터셋에서 최신 기술 성능을 달성하였다.
- 제안된 VLTF 융합 모듈은 mRR 및 rIoU 지표에서 PWAN + LP를 능가하여 부정 입력에 대한 우수한 강건성을 입증하였다.
- VLTF를 갖춘 RefSegformer는 R-RIS 벤치마크에서 46.08의 rIoU와 73.73의 mRR를 기록하여, 부정 입력에 일반화하지 못하는 베이스라인을 크게 앞서갔다.
- 실패 사례 분석 결과, 모델은 유사한 형태를 가진 객체(예: 낙타를 청소개로 오해)에 대해 어려움을 겪는 것으로 나타나, 보다 나은 형태 및 맥락 일반화가 필요함을 시사한다.
- 각 인스턴스당 참조 문장당 10개의 부정 문장을 포함한 새로운 R-RIS 벤치마크는 단일 부정 쌍 벤치마크보다 모델의 강건성에 대해 더 엄격한 시험을 제공한다.
- rIoU 및 mRR 지표는 정확도와 강건성을 효과적으로 포괄하며, R-RIS 모델에 대한 통합 평가 프레임워크를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.