Skip to main content
QUICK REVIEW

[논문 리뷰] PolyFormer: Referring Image Segmentation as Sequential Polygon Generation

Jiang Liu, Hui Ding|arXiv (Cornell University)|2023. 02. 14.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

PolyFormer는 새로운 시퀀스-투-시퀀스 Transformer 프레임워크를 사용하여 참조 이미지 세그멘테이션을 순차적 다각형 생성 문제로 재정의한다. 이는 회귀를 통해 연속적인 2D 좌표를 직접 예측함으로써 이산화 오차를 방지한다. RefCOCO+와 RefCOCOg에서 각각 5.40%, 4.52%의 절대 mIoU 향상을 달성하며 최고 성능을 기록했고, 미세조정 없이도 참조 영상 세그멘테이션에 잘 일반화된다.

ABSTRACT

In this work, instead of directly predicting the pixel-level segmentation masks, the problem of referring image segmentation is formulated as sequential polygon generation, and the predicted polygons can be later converted into segmentation masks. This is enabled by a new sequence-to-sequence framework, Polygon Transformer (PolyFormer), which takes a sequence of image patches and text query tokens as input, and outputs a sequence of polygon vertices autoregressively. For more accurate geometric localization, we propose a regression-based decoder, which predicts the precise floating-point coordinates directly, without any coordinate quantization error. In the experiments, PolyFormer outperforms the prior art by a clear margin, e.g., 5.40% and 4.52% absolute improvements on the challenging RefCOCO+ and RefCOCOg datasets. It also shows strong generalization ability when evaluated on the referring video segmentation task without fine-tuning, e.g., achieving competitive 61.5% J&F on the Ref-DAVIS17 dataset.

연구 동기 및 목표

  • 픽셀 단위의 세그멘테이션 한계를 해결하기 위해 객체 경계를 구조화된 다각형 시퀀스로 모델링함으로써 참조 이미지 세그멘테이션 문제를 개선한다.
  • 정점 예측에 이산 좌표 이산화를 대체하기 위해 연속 회귀를 사용함으로써 기하학적 국소화 정확도를 향상시킨다.
  • 동일한 시퀀스-투-시퀀스 프레임워크를 통해 참조 이미지 세그멘테이션과 참조 표현 이해를 통합한다.
  • 미세조정 없이도 비디오 기반 참조 세그멘테이션 작업에 대해 제로샷 일반화를 가능하게 한다.
  • 비디오 기반 참조 세그멘테이션 작업에 대해 미세조정 없이도 제로샷 일반화를 가능하게 한다.

제안 방법

  • PolyFormer는 이미지 패치 토큰과 텍스트 쿼리 토큰을 연결하여 입력으로 사용하는 시퀀스-투-시퀀스 Transformer 아키텍처를 사용한다.
  • 모델은 이전의 모든 정점에 조건을 부여하여 공간적 구조를 유지하면서 다각형 정점의 순차적 시퀀스를 자동으로 생성한다.
  • 이산화된 버킷에 의존하는 오차를 제거하기 위해, 색인된 임베딩 위에서 이중선형 보간을 사용하여 정밀한 부동소수점 좌표를 예측하는 회귀 기반 디코더를 사용한다.
  • 분리자 토큰을 사용하여 다중 다각형 인스턴스를 처리함으로써 다중 작업 학습을 지원한다.
  • 다각형 정점은 이미지 원점에 가장 가까운 점에서 시작하여 시계방향으로 순서를 정한다. 이는 일관되고 의미 있는 시퀀스 생성을 보장한다.
  • 훈련 중에 데이터 증강 기법을 적용하여 다양한 정도의 정밀도로 다각형을 생성함으로써, 강인성과 일반화 능력을 향상시킨다.
Figure 1 : The illustration of PolyFormer pipeline for referring image segmentation (polygon vertex sequence) and referring expression comprehension (bounding box corner points). The polygons are converted to segmentation masks in the end.
Figure 1 : The illustration of PolyFormer pipeline for referring image segmentation (polygon vertex sequence) and referring expression comprehension (bounding box corner points). The polygons are converted to segmentation masks in the end.

실험 결과

연구 질문

  • RQ1참조 이미지 세그멘테이션을 조밀한 픽셀 단위 예측이 아닌 순차적 다각형 생성 문제로 효과적으로 재정의할 수 있는가?
  • RQ2기하학적 국소화 작업에서 분류 기반 방법에 비해 연속 2D 좌표 예측을 위한 회귀 기반 디코더가 성능이 뛰어나지 않는가?
  • RQ3공유된 다중 모odal 특징을 사용하는 통합된 시퀀스-투-시퀀스 프레임워크가 참조 이미지 세그멘테이션과 참조 표현 이해를 함께 처리할 수 있는가?
  • RQ4제안된 프레임워크는 미세조정 없이 제로샷 참조 영상 세그멘테이션에 얼마나 잘 일반화되는가?
  • RQ5다각형 순서, 데이터 증강, 다중 작업 학습과 같은 설계 선택 사항이 다각형 생성 성능에 어떤 영향을 미치는가?

주요 결과

  • PolyFormer는 RefCOCO에서 76.94% mIoU, RefCOCO+에서 72.15%, RefCOCOg에서 71.15%를 기록하여 각각 2.48%, 5.40%, 4.52%의 절대 향상률을 기록하며 새로운 최고 성능을 달성했다.
  • RIS 및 REC 작업에서 각각 +1.86 및 +2.38 mIoU의 향상을 보이며, 분류 기반 기준 모델에 비해 더 뛰어난 국소화 정확도를 입증했다.
  • 미세조정 없이도 Ref-DAVIS17에서 참조 영상 세그멘테이션에 대해 61.5% J&F를 달성하여 강력한 제로샷 일반화 능력을 보였다.
  • 다각형 순서가 매우 중요하여, 무작위 순서 대비 mIoU가 12.43% 향상되었고, 데이터 증강과 다중 작업 학습 각각 3.72%와 3.07%의 기여를 보였다.
  • <SEP> 토큰을 다중 다각형 처리에 도입함으로써 mIoU가 0.82% 향상되었으며, 이는 다중 다각형 인스턴스의 빈도가 낮음에도 불구하고 유용함을 시사한다.
  • 시각화 결과는 어텐션 맵이 참조된 객체에 집중하고 다각형 생성 중에 경계를 역동적으로 추적함을 보여주며, 어텐션의 의미적 의도와의 일치를 확인한다.
Figure 2 : Overview of our PolyFormer architecture. The model takes an image and its corresponding language expression as input, and outputs the floating-point 2D coordinates of the bounding box and polygons in an autoregressive way.
Figure 2 : Overview of our PolyFormer architecture. The model takes an image and its corresponding language expression as input, and outputs the floating-point 2D coordinates of the bounding box and polygons in an autoregressive way.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.