[논문 리뷰] Tracking Anything in High Quality
이 논문은 고품질 비디오 객체 추적 및 분할을 위한 이단계 프레임워크인 HQTrack을 제안한다. 이는 사전 훈련된 HQ-SAM 모델을 사용하여 비디오 다중객체 분할기(VMOS)와 마스크 개선기(MR)를 결합한 것으로, 저 IoU 마스크는 IoU 임계값 기반으로 선택적으로 개선함으로써 최신 기술 수준(SOTA) 성능을 달성한다. 테스트 시 데이터 증강 또는 모델 앙상블 없이도 VOTS2023 대회에서 2위를 기록하였다.
Visual object tracking is a fundamental video task in computer vision. Recently, the notably increasing power of perception algorithms allows the unification of single/multiobject and box/mask-based tracking. Among them, the Segment Anything Model (SAM) attracts much attention. In this report, we propose HQTrack, a framework for High Quality Tracking anything in videos. HQTrack mainly consists of a video multi-object segmenter (VMOS) and a mask refiner (MR). Given the object to be tracked in the initial frame of a video, VMOS propagates the object masks to the current frame. The mask results at this stage are not accurate enough since VMOS is trained on several closeset video object segmentation (VOS) datasets, which has limited ability to generalize to complex and corner scenes. To further improve the quality of tracking masks, a pretrained MR model is employed to refine the tracking results. As a compelling testament to the effectiveness of our paradigm, without employing any tricks such as test-time data augmentations and model ensemble, HQTrack ranks the 2nd place in the Visual Object Tracking and Segmentation (VOTS2023) challenge. Code and models are available at https://github.com/jiawen-zhu/HQTrack.
연구 동기 및 목표
- 복잡한 비디오 시퀀스에서 장기 추적, 가림, 오염자, 외관 변화 등의 과제를 해결하기 위해.
- 특히 작은 객체, 빠른 움직임, 심한 가림을 겪는 객체에 대해 표준 비디오 객체 분할 모델을 초월하는 마스크 품질을 향상시키기 위해.
- 단일 및 다중 객체 추적을 모두 처리할 수 있는 밀도 있는 마스크 출력을 지원하는 강력하고 일반화 가능한 추적 시스템을 개발하기 위해.
- 저품질 마스크를 개선함으로써 성능 저하를 최소화하기 위해 IoU 임계값 기반의 선택적 개선 전략을 도입하기 위해.
제안 방법
- VMOS는 더 나은 특징 표현을 위해 InternImage-T를 백본으로 사용하고, 작은 객체 인식을 위해 1/8 해상도의 게이트드 전파 모듈을 활용한 DeAOT 기반의 개선된 비디오 다중객체 분할기이다.
- 장기 메모리 메커니즘은 고정 길이로 설계되어 장시간 비디오 시퀀스에서 메모리 사용을 관리하며, 임계값을 초과한 후 초기 프레임의 메모리는 기각된다.
- 마스크 개선기(MR)는 사전 훈련된 HQ-SAM_H 모델을 사용하여 VMOS의 분할 마스크를 개선함으로써 복잡한 구조에서 정확도를 향상시킨다.
- 선택적 개선 전략이 적용되며, VMOS와 SAM 출력 간 IoU > τ 인 마스크만 교체되어 저품질 예측에서의 성능 저하를 방지한다.
- IoU 임계값 τ는 검증 세트에서 최적화되며, τ = 0.1일 때 최고의 성능를 기록하였다.
- 프레임워크는 VOS 데이터셋에서 엔드 투 엔드로 훈련되고 VOTS2023에서 파인튜닝되며, 추론 시 테스트 시 데이터 증강 또는 앙상블 기법을 사용하지 않는다.
실험 결과
연구 질문
- RQ1비디오 다중객체 분할기와 대규모 마스크 개선기의 조합으로 구성된 이단계 추적 프레임워크가 밀도 있는 마스크 출력을 제공하는 장기적, 다중객체 비디오 추적에서 최신 기술 수준 성능를 달성할 수 있는가?
- RQ2사전 훈련된 대규모 모델인 HQ-SAM_H를 사용한 선택적 마스크 개선 전략은 저품질 예측에서의 성능 저하를 방지하는 데 얼마나 효과적인가?
- RQ310,000 프레임 이상의 장시간 비디오 시퀀스에서 메모리 효율성과 장기 추적의 강건성 사이의 최적의 균형은 무엇인가?
- RQ4더 강력한 백본(InternImage-T)과 게이트드 전파 모듈은 어떻게 복잡한 환경에서의 작은 객체 추적 성능을 향상시키는가?
주요 결과
- HQTrack는 VOTS2023 테스트 세트에서 AUC 점수 0.615를 기록하여, 테스트 시 데이터 증강 또는 모델 앙상블 없이도 2위를 기록하였다.
- VMOS의 ResNet50 백본을 InternImage-T로 교체함으로써 AUC 점수가 3.2% 향상되어 강력한 특징 추출의 이점이 입증되었다.
- SAM_H를 도입한 마스크 개선은 VMOS 단독 사용 대비 AUC 점수를 1.4% 향상시켜 대규모 사전 훈련 모델의 가치를 입증하였다.
- τ = 0.1로 설정된 선택적 개선 전략이 최고의 성능를 기록하였으며, 저 IoU 마스크에서의 성능 저하를 줄이고 다양한 과제 상황에서도 높은 정확도를 유지하였다.
- 프레임워크는 장시간 시퀀스(>10,000 프레임), 빠른 운동, 가림, 오염자를 성공적으로 처리하여 실제 환경에서 뛰어난 강건성을 입증하였다.
- 정성적 결과는 HQTrack가 심한 외관 변화와 척도 변화 조건에서도 매우 정확하고 안정적인 마스크를 생성함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.