[논문 리뷰] SeqTR: A Simple yet Universal Network for Visual Grounding
이 논문은 시퀀스 예측을 통해 바운딩 박스 및 마스크 예측 문제를 재구성함으로써 단순하면서도 보편적인 Transformer 기반 네트워크인 SeqTR을 제안한다. 이는 이산 좌표 토큰을 사용하여 바운딩 박스와 마스크 예측을 순차적 점 예측 문제로 재정의한다. 서로 다른 작업을 위한 특수한 헤드나 복잡한 손실 함수 없이도, 하나의 교차 엔트로피 손실과 공통된 아키텍처를 통해 문장 국소화, 참조 표현 이해, 세분화를 통합함으로써, 다섯 가지 벤치마크에서 최신 기술 수준(SOTA) 또는 경쟁력 있는 성능을 달성한다.
In this paper, we propose a simple yet universal network termed SeqTR for visual grounding tasks, e.g., phrase localization, referring expression comprehension (REC) and segmentation (RES). The canonical paradigms for visual grounding often require substantial expertise in designing network architectures and loss functions, making them hard to generalize across tasks. To simplify and unify the modeling, we cast visual grounding as a point prediction problem conditioned on image and text inputs, where either the bounding box or binary mask is represented as a sequence of discrete coordinate tokens. Under this paradigm, visual grounding tasks are unified in our SeqTR network without task-specific branches or heads, e.g., the convolutional mask decoder for RES, which greatly reduces the complexity of multi-task modeling. In addition, SeqTR also shares the same optimization objective for all tasks with a simple cross-entropy loss, further reducing the complexity of deploying hand-crafted loss functions. Experiments on five benchmark datasets demonstrate that the proposed SeqTR outperforms (or is on par with) the existing state-of-the-arts, proving that a simple yet universal approach for visual grounding is indeed feasible. Source code is available at https://github.com/sean-zhuh/SeqTR.
연구 동기 및 목표
- 특수한 작업 아키텍처나 손실 함수 없이 시각적 기반 모델링을 단순화하기 위해.
- 문장 국소화, 참조 표현 이해, 세분화를 하나의 공통된 네트워크 아키텍처로 통합하기 위해.
- 공통 최적화 목표를 통해 시각-언어 정렬의 다중 작업 학습 복잡도를 줄이기 위해.
- 최소한의 아키텍처 및 손실 설계로 종단간 학습을 가능하게 하기 위해.
- 간단하고 보편적인 접근 방식이 시각적 기반에서 최신 기술 수준의 성능을 달성하거나 초월할 수 있음을 입증하기 위해.
제안 방법
- 바운딩 박스와 이진 마스크를 이산 좌표 토큰으로 표현함으로써 시각적 기반 문제를 순차 예측 문제로 재구성하기.
- 표준 Transformer 인코더-디코더 아키텍처를 사용하여 이미지 및 텍스트 입력에서 좌표 토큰을 자동으로 회귀 예측하기.
- 픽셀 수준의 세분화를 N개의 점으로 이루어진 순서로 변환하기 위해 시계방향 윤곽선 샘플링을 통해 마스크를 표현하기.
- 모든 작업에 대해 단일 교차 엔트로피 손실을 사용하여 특수한 작업 손실 함수가 필요 없도록 하기.
- 학습 중에 점 순서를 무작위로 섞음으로써 일반화 성능과 강인성을 향상시키기.
- 아키텍처 수정 없이 다중 작업 학습을 가능하게 하여 REC 및 RES의 공동 최적화를 허용하기.
실험 결과
연구 질문
- RQ1특수한 작업 분지가 없는 단순한 아키텍처로도 시각적 기반 작업을 통합할 수 있는가?
- RQ2복잡한 특수 작업 손실 함수 대신 보편적인 교차 엔트로피 손실이 시각적 기반에서 사용될 수 있는가?
- RQ3좌표 토큰 생성을 통한 순차적 점 예측이 바운딩 박스 및 마스크 양쪽 모두에 공간 정확도를 유지할 수 있는가?
- RQ4특수화된 아키텍처 없이도 하나의 모델이 국소화 및 세분화 벤치마크에서 뛰어난 성능을 낼 수 있는가?
- RQ5점 샘플링 전략과 순서 섞기 방법이 모델의 일반화 성능에 어떤 영향을 미치는가?
주요 결과
- SeqTR는 RefCOCO, RefCOCO+, RefCOCOg, ReferItGame, Flickr30K Entities 등 다섯 가지 벤치마크에서 최신 기술 수준 또는 경쟁력 있는 성능을 달성한다.
- RefCOCO에서 SeqTR는 80.38% REC 정확도와 78.03% mIoU를 기록하여 mIoU 성능에서 이전 방법을 초월하면서도 높은 국소화 정확도를 유지한다.
- 균일한 샘플링과 18개의 점을 사용할 경우 95.57%의 상한 mIoU를 달성하여 마스크 재구성의 높은 정밀도를 보여준다.
- 단일 작업 학습 대비 다중 작업 학습에서 성능이 약간 떨어지며, 이는 순차 기반 프레임워크에서 REC 및 RES 예측이 상호 독립적임을 시사한다.
- 학습 중 점 섞기를 통해 수렴 속도와 강인성이 향상되었으며, RefCOCO 및 RefCOCO+에서 0.2의 섞기 비율이 최적의 성능을 낳는다.
- SeqTR는 훨씬 낮은 사전학습 비용으로도 대규모 BERT 스타일 모델을 능가하는 성능을 보이며, 효율성과 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.