[논문 리뷰] ReSTR: Convolution-free Referring Image Segmentation Using Transformers
ReSTR는 트랜스포머를 사용하여 컨볼루션 없는 참조 이미지 세그멘테이션 모델을 제안하며, 시각 및 언어 트랜스포머 인코더를 활용해 장거리 의존성을 포착하고, 유연하고 적응형 다중모달 상호작용을 위한 다중모달 융합 트랜스포머를 제공한다. 경량이며 효율적인 디코더와 이전 방법들에 비해 감소된 계산 비용을 바탕으로 모든 공개 벤치마크에서 최고 성능을 달성한다.
Referring image segmentation is an advanced semantic segmentation task where target is not a predefined class but is described in natural language. Most of existing methods for this task rely heavily on convolutional neural networks, which however have trouble capturing long-range dependencies between entities in the language expression and are not flexible enough for modeling interactions between the two different modalities. To address these issues, we present the first convolution-free model for referring image segmentation using transformers, dubbed ReSTR. Since it extracts features of both modalities through transformer encoders, it can capture long-range dependencies between entities within each modality. Also, ReSTR fuses features of the two modalities by a self-attention encoder, which enables flexible and adaptive interactions between the two modalities in the fusion process. The fused features are fed to a segmentation module, which works adaptively according to the image and language expression in hand. ReSTR is evaluated and compared with previous work on all public benchmarks, where it outperforms all existing models.
연구 동기 및 목표
- 참조 이미지 세그멘테이션에서 시각적 및 언어적 모odal에서 장거리 의존성을 포착하는 데에 컨볼루션 신경망의 한계를 해결하기 위해.
- 기존 모델에서의 고정된 수작업 특징 융합 방식을 넘어서 시각적 및 언어적 특징 간의 다이나믹하고 적응형 상호작용을 가능하게 하기 위해.
- 패치 수준 예측을 고해상도 픽셀 수준 출력으로 정교화하는 경량이며 효율적인 세그멘테이션 디코더를 설계하기 위해.
- 계산 비용을 최소화하면서도 공개 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- ReSTR는 자기주도 어텐션을 통해 전반적인 맥락을 포착하는 비중첩 이미지 패치에서 특징을 추출하기 위해 시각 트랜스포머 인코더를 사용한다.
- 자연어 표현의 장거리 의존성을 모델링하기 위해 단어 임베딩에 언어 트랜스포머 인코더를 적용한다.
- 시각적 및 언어적 특징을 자기주도 어텐션을 사용해 융합하는 다중모달 융합 트랜스포머 인코더를 통해 두 모달 간의 동적이고 적응형 상호작용을 가능하게 한다.
- 융합 인코더는 언어 쿼리에서 설명된 대상 엔티티에 맞게 조정된 클래스 시드 임베딩에서 적응형 분류기를 생성한다.
- 粗-세분화 디코더는 적응형 분류기를 패치 수준 특징에 적용하고 선형 레이어를 통해 업샘플링하여 픽셀 수준의 세그멘테이션 마스크를 생성한다.
- 융합 인코더에서 가중치 공유를 사용하여 성능 저하를 최소화하면서 파라미터 수를 감소시킨다.

실험 결과
연구 질문
- RQ1트랜스포머 기반의 컨볼루션 없는 아키텍처가 장거리 의존성을 더 잘 모델링함으로써 CNN 기반 모델보다 참조 이미지 세그멘테이션에서 우수한 성능을 내는가?
- RQ2자기주도 어텐션 기반의 다중모달 융합 메커니즘이 연결-컨볼루션 융합 방식보다 시각적 및 언어적 특징 간의 더 유연하고 적응형 상호작용을 가능하게 하는가?
- RQ3경량이며 굵기-세분화 디코더가 계산 비용을 줄이면서도 높은 정확도를 달성하는가?
- RQ4융합 인코더의 트랜스포머 레이어 수가 성능 및 효율성에 어떤 영향을 미치는가?
주요 결과
- ReSTR는 참조 이미지 세그멘테이션을 위한 네 가지 공개 벤치마크에서 모두 최고 성능을 기록하며 이전 모델을 압도한다.
- Gref 검증 세트에서 ReSTR는 IoU 54.48%를 달성하여 이어지는 최고 성능 모델(ACM)보다 2.55%p 높은 성능을 보였다.
- 입력 크기가 320×320일 때 MACs를 52.29G로 줄여 이전 방법들보다 크게 감소시켰으며, 높은 정확도를 유지했다.
- 4층 융합 인코더를 사용할 경우 세그멘테이션 디코더가 IoU를 1.67%p 향상시켜 굵은 예측을 정교화하는 데 효과적임을 입증했다.
- 융합 인코더에서 가중치 공유를 통해 파라미터 수를 122.87M에서 108.70M로 줄였고 성능 저하도 0.41%에 그쳐 강력한 효율성을 보였다.
- 정성적 결과는 ReSTR가 다양한 언어 표현, 예를 들어 '택시의 뒤에 있는'과 같은 관계적 묘사까지도 정확하게 목표 영역을 국소화함을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.