[논문 리뷰] PolyFormer: Referring Image Segmentation as Sequential Polygon Generation
PolyFormer는 새로운 시퀀스-투-시퀀스 Transformer 프레임워크를 사용하여 참조 이미지 세그멘테이션을 순차적 다각형 생성 문제로 재정의한다. 이는 회귀를 통해 연속적인 2D 좌표를 직접 예측함으로써 이산화 오차를 방지한다. RefCOCO+와 RefCOCOg에서 각각 5.40%, 4.52%의 절대 mIoU 향상을 달성하며 최고 성능을 기록했고, 미세조정 없이도 참조 영상 세그멘테이션에 잘 일반화된다.
In this work, instead of directly predicting the pixel-level segmentation masks, the problem of referring image segmentation is formulated as sequential polygon generation, and the predicted polygons can be later converted into segmentation masks. This is enabled by a new sequence-to-sequence framework, Polygon Transformer (PolyFormer), which takes a sequence of image patches and text query tokens as input, and outputs a sequence of polygon vertices autoregressively. For more accurate geometric localization, we propose a regression-based decoder, which predicts the precise floating-point coordinates directly, without any coordinate quantization error. In the experiments, PolyFormer outperforms the prior art by a clear margin, e.g., 5.40% and 4.52% absolute improvements on the challenging RefCOCO+ and RefCOCOg datasets. It also shows strong generalization ability when evaluated on the referring video segmentation task without fine-tuning, e.g., achieving competitive 61.5% J&F on the Ref-DAVIS17 dataset.
연구 동기 및 목표
- 픽셀 단위의 세그멘테이션 한계를 해결하기 위해 객체 경계를 구조화된 다각형 시퀀스로 모델링함으로써 참조 이미지 세그멘테이션 문제를 개선한다.
- 정점 예측에 이산 좌표 이산화를 대체하기 위해 연속 회귀를 사용함으로써 기하학적 국소화 정확도를 향상시킨다.
- 동일한 시퀀스-투-시퀀스 프레임워크를 통해 참조 이미지 세그멘테이션과 참조 표현 이해를 통합한다.
- 미세조정 없이도 비디오 기반 참조 세그멘테이션 작업에 대해 제로샷 일반화를 가능하게 한다.
- 비디오 기반 참조 세그멘테이션 작업에 대해 미세조정 없이도 제로샷 일반화를 가능하게 한다.
제안 방법
- PolyFormer는 이미지 패치 토큰과 텍스트 쿼리 토큰을 연결하여 입력으로 사용하는 시퀀스-투-시퀀스 Transformer 아키텍처를 사용한다.
- 모델은 이전의 모든 정점에 조건을 부여하여 공간적 구조를 유지하면서 다각형 정점의 순차적 시퀀스를 자동으로 생성한다.
- 이산화된 버킷에 의존하는 오차를 제거하기 위해, 색인된 임베딩 위에서 이중선형 보간을 사용하여 정밀한 부동소수점 좌표를 예측하는 회귀 기반 디코더를 사용한다.
- 분리자 토큰을 사용하여 다중 다각형 인스턴스를 처리함으로써 다중 작업 학습을 지원한다.
- 다각형 정점은 이미지 원점에 가장 가까운 점에서 시작하여 시계방향으로 순서를 정한다. 이는 일관되고 의미 있는 시퀀스 생성을 보장한다.
- 훈련 중에 데이터 증강 기법을 적용하여 다양한 정도의 정밀도로 다각형을 생성함으로써, 강인성과 일반화 능력을 향상시킨다.

실험 결과
연구 질문
- RQ1참조 이미지 세그멘테이션을 조밀한 픽셀 단위 예측이 아닌 순차적 다각형 생성 문제로 효과적으로 재정의할 수 있는가?
- RQ2기하학적 국소화 작업에서 분류 기반 방법에 비해 연속 2D 좌표 예측을 위한 회귀 기반 디코더가 성능이 뛰어나지 않는가?
- RQ3공유된 다중 모odal 특징을 사용하는 통합된 시퀀스-투-시퀀스 프레임워크가 참조 이미지 세그멘테이션과 참조 표현 이해를 함께 처리할 수 있는가?
- RQ4제안된 프레임워크는 미세조정 없이 제로샷 참조 영상 세그멘테이션에 얼마나 잘 일반화되는가?
- RQ5다각형 순서, 데이터 증강, 다중 작업 학습과 같은 설계 선택 사항이 다각형 생성 성능에 어떤 영향을 미치는가?
주요 결과
- PolyFormer는 RefCOCO에서 76.94% mIoU, RefCOCO+에서 72.15%, RefCOCOg에서 71.15%를 기록하여 각각 2.48%, 5.40%, 4.52%의 절대 향상률을 기록하며 새로운 최고 성능을 달성했다.
- RIS 및 REC 작업에서 각각 +1.86 및 +2.38 mIoU의 향상을 보이며, 분류 기반 기준 모델에 비해 더 뛰어난 국소화 정확도를 입증했다.
- 미세조정 없이도 Ref-DAVIS17에서 참조 영상 세그멘테이션에 대해 61.5% J&F를 달성하여 강력한 제로샷 일반화 능력을 보였다.
- 다각형 순서가 매우 중요하여, 무작위 순서 대비 mIoU가 12.43% 향상되었고, 데이터 증강과 다중 작업 학습 각각 3.72%와 3.07%의 기여를 보였다.
- <SEP> 토큰을 다중 다각형 처리에 도입함으로써 mIoU가 0.82% 향상되었으며, 이는 다중 다각형 인스턴스의 빈도가 낮음에도 불구하고 유용함을 시사한다.
- 시각화 결과는 어텐션 맵이 참조된 객체에 집중하고 다각형 생성 중에 경계를 역동적으로 추적함을 보여주며, 어텐션의 의미적 의도와의 일치를 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.