[논문 리뷰] Tracking Instances as Queries
이 논문은 추적된 인스턴스를 학습 가능한 쿼리로 간주하고, 쿼리와 인스턴스 간 일대일 대응을 활용하여 강력한 시간적 연관성을 확보하는 통합형 엔드 투 엔드 쿼리 기반 비디오 인스턴스 세그멘테이션 프레임워크인 QueryTrack를 제안한다. 단일 온라인 모델, 단일 스케일 추론, 보통 수준의 훈련 데이터를 사용하여 YouTube-VIS-2021에서 52.7% AP를 달성하고 CVPR 2021 챌린지에서 2위를 기록하였다.
Recently, query based deep networks catch lots of attention owing to their end-to-end pipeline and competitive results on several fundamental computer vision tasks, such as object detection, semantic segmentation, and instance segmentation. However, how to establish a query based video instance segmentation (VIS) framework with elegant architecture and strong performance remains to be settled. In this paper, we present extbf{QueryTrack} (i.e., tracking instances as queries), a unified query based VIS framework fully leveraging the intrinsic one-to-one correspondence between instances and queries in QueryInst. The proposed method obtains 52.7 / 52.3 AP on YouTube-VIS-2019 / 2021 datasets, which wins the 2-nd place in the YouTube-VIS Challenge at CVPR 2021 extbf{with a single online end-to-end model, single scale testing \& modest amount of training data}. We also provide QueryTrack-ResNet-50 baseline results on YouTube-VIS-2021 val set as references for the VIS community.
연구 동기 및 목표
- 기존 비디오 인스턴스 세그멘테이션(VIS) 방법이 인스턴스 간 시간적 연관성에 대해 히ュ리스틱이고 미분 불가능한 후처리에 의존하는 한계를 해결하기 위해.
- QueryInst와 마찬가지로 인스턴스와 쿼리 간 내재된 일대일 대응을 활용하는 통합형 엔드 투 엔드 쿼리 기반 VIS 프레임워크를 구축하기 위해.
- 시간적 인스턴스 매칭에서 하이퍼파rameter 및 수작업 설계된 연산자에 대한 의존도를 줄이기 위해 전용 추적 헤드를 도입하기 위해.
- 더 신뢰할 수 있는 YouTube-VIS-2021 벤치마크를 활용해 향후 VIS 연구를 위한 강력하고 재현 가능한 기준을 제공하기 위해.
- 제한된 훈련 데이터와 단일 스케일 추론 조건에서도 단순하고 우아한 아키텍처로 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- QueryTrack는 쿼리 기반 인스턴스 세그멘테이션 백본을 사용하며, 네트워크 단계 전반에 걸쳐 객체 쿼리와 검출된 인스턴스 간 일대일 매핑을 유지한다.
- 시간적 인스턴스 연관성을 위해 쿼리 표현을 활용하는 새로운 추적 헤드를 도입하여 히ュ리스틱 매칭을 대체하는 미분 가능한 쿼리 기반 추적을 실현한다.
- 이전 프레임의 쿼리 특징을 사용해 현재 프레임의 각 인스턴스 위치와 마스크를 예측함으로써 엔드 투 엔드 최적화를 가능하게 한다.
- 특징 피라미드(FPN)와 동적 컨볼루션 모듈을 사용해 쿼리 특징을 정교화하고 검출 및 세그멘테이션 정확도를 향상시킨다.
- 추론 중에는 각 프레임당 상위 10개의 점수 기반 쿼리만 유지하여 효율성과 실제 비디오에 대한 확장성 확보 (제한된 인스턴스 수 기반).
- 훈련 시 표준 데이터 증강 기법(랜덤 플립, 다중 스케일 입력, 랜덤 크롭)을 사용하며, 코즈인 감소 학습률 스케줄과 고정된 쿼리 수(100개)를 사용해 추론을 수행한다.
실험 결과
연구 질문
- RQ1학습 가능한 쿼리를 통해 직접 인스턴스 추적을 모델링함으로써 쿼리 기반 프레임워크가 엔드 투 엔드 비디오 인스턴스 세그멘테이션을 달성할 수 있는가?
- RQ2쿼리와 인스턴스 간 일대일 대응을 활용할 경우 시간적 연관성의 강건성은 어떻게 향상되고 하이퍼파rameter 민감도는 어떻게 감소하는가?
- RQ3쿼리 기반 추적 메커니즘을 사용해 최소한의 훈련 데이터와 단일 스케일 추론 조건에서 어떤 성능 향상이 달성될 수 있는가?
- RQ4더 신뢰할 수 있는 YouTube-VIS-2021 벤치마크에서 제안된 방법은 최신 기술 수준의 VIS 모델과 비교해 어떻게 성능를 내는가?
- RQ5QueryTrack는 향후 비디오 인스턴스 세그멘테이션 연구를 위한 강력하고 재현 가능한 기준이 될 수 있는가?
주요 결과
- QueryTrack는 YouTube-VIS-2021 테스트 세트에서 52.7% AP를 달성했으며, 단일 온라인 엔드 투 엔드 모델로 CVPR 2021 챌린지에서 2위를 기록하였다.
- YouTube-VIS-2021 검증 세트에서 ResNet-50 백본을 사용한 QueryTrack는 38.8% AP, 62.0% AP50, 42.3% AP75를 기록하여 강력한 기준을 확립하였다.
- Swin-L 백본을 사용할 경우 48.8% AP를 기록했고, ResNeXt-101-DCN 백본을 사용할 경우 52.7% AP를 달성하여 MaskTrack R-CNN, SipMask-VIS, CrossVIS, IFC 등 최신 기술 수준의 모델들을 초월하였다.
- 제안된 추적 헤드는 전통적인 히ュ리스틱 연관 방법 대비 하이퍼파rameter 수를 크게 감소시켜 훈련 안정성과 일반화 능력을 향상시켰다.
- 결과적으로 쿼리 기반 추적은 제한된 훈련 데이터와 단일 스케일 추론 조건에서도 매우 효과적임을 입증하였으며, Open Images와 같은 대규모 데이터에 의존하는 방법들보다도 뛰어난 성능을 보였다.
- 저변동성과 향상된 재현 가능성 덕분에 YouTube-VIS-2021 벤치마크의 사용을 권장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.