[논문 리뷰] Efficient Video Instance Segmentation via Tracklet Query and Proposal
이 논문은 트랙렛 쿼리와 프포지션을 사용하여 효율적이고 실시간 추론 및 빠른 훈련을 가능하게 하는 완전한 엔드 투 엔드 비디오 인스턴스 세그멘테이션 프레임워크인 EfficientVIS를 제안한다. 클립 간 상호작용과 대응 학습을 통한 ROI 기반 쿼리-비디오 상호작용을 통해 YouTube-VIS에서 최신 기술 수준의 정확도를 달성하였으며, 수동으로 설계된 데이터 연동이 필요 없게 되었다.
Video Instance Segmentation (VIS) aims to simultaneously classify, segment, and track multiple object instances in videos. Recent clip-level VIS takes a short video clip as input each time showing stronger performance than frame-level VIS (tracking-by-segmentation), as more temporal context from multiple frames is utilized. Yet, most clip-level methods are neither end-to-end learnable nor real-time. These limitations are addressed by the recent VIS transformer (VisTR) which performs VIS end-to-end within a clip. However, VisTR suffers from long training time due to its frame-wise dense attention. In addition, VisTR is not fully end-to-end learnable in multiple video clips as it requires a hand-crafted data association to link instance tracklets between successive clips. This paper proposes EfficientVIS, a fully end-to-end framework with efficient training and inference. At the core are tracklet query and tracklet proposal that associate and segment regions-of-interest (RoIs) across space and time by an iterative query-video interaction. We further propose a correspondence learning that makes tracklets linking between clips end-to-end learnable. Compared to VisTR, EfficientVIS requires 15x fewer training epochs while achieving state-of-the-art accuracy on the YouTube-VIS benchmark. Meanwhile, our method enables whole video instance segmentation in a single end-to-end pass without data association at all.
연구 동기 및 목표
- 기존 클립 수준의 비디오 인스턴스 세그멘테이션 방법의 느린 수렴성과 비엔드 투 엔드 성격의 부족을 해결하기 위해.
- 다중 클립 비디오 처리에서 수동으로 설계된 데이터 연동이 필요 없도록 하기 위해.
- 고정밀 세그멘테이션 정확도를 유지하면서 실시간 추론과 빠른 훈련을 가능하게 하기 위해.
- 향상된 시간적 맥락 모델링을 통해 물체의 가림과 운동 흐림에 대한 강건성을 향상시키기 위해.
- 전체 비디오에 걸쳐 클립 간 트랙렛 연결까지 포함된 완전한 엔드 투 엔드 학습을 가능하게 하기 위해.
제안 방법
- 트랙렛 쿼리 도입: 학습 가능한 잠재 표현으로, 인스턴스의 외관을 인코딩하며 대응 학습을 통해 클립 간 업데이트된다.
- 트랙렛 프포지션 활용: 각 인스턴스의 관심 영역을 정의하는 스페이스-타임 튜브로, 계산량과 배경 잡음 감소에 기여한다.
- 시간적 동적 컨볼루션 적용: 프포지션 내 프레임 간 특징을 집계하여 시간적 맥락을 풍부하게 한다.
- 분리된 시간-공간 자기주의 어텐션 적용: 쿼리가 공간과 시간 모두에서 상호작용할 수 있도록 하여 한 번의 순방향 전파로 전체 트랙렛 마스크 생성을 가능하게 한다.
- 대응 학습 메커니즘 설계: 클립 간 트랙렛 쿼리를 공유하고 업데이트함으로써, 데이터 연동 없이도 엔드 투 엔드 클립 간 연동을 가능하게 한다.
- ROI 기반 쿼리-비디오 상호작용 적용: 프포지션으로 정의된 영역에 집중함으로써, VisTR의 프레임 기반 밀도 어텐션 대비 부과적인 어텐션을 크게 감소시킨다.
실험 결과
연구 질문
- RQ1클립 수준의 비디오 인스턴스 세그멘테이션 프레임워크는 고정밀도를 유지하면서도 빠른 수렴을 달성할 수 있는가?
- RQ2엔드 투 엔드 학습이 단일 클립을 넘어서 다중 클립 간 원활하고 학습 가능한 트랙렛 연결을 가능하게 할 수 있는가?
- RQ3다중 클립 VIS에서 수동으로 설계된 데이터 연동 의존도를 학습 가능한 대응 메커니즘으로 제거할 수 있는가?
- RQ4ROI 기반 쿼리 상호작용은 밀도 어텐션 대비 훈련 효율성과 세그멘테이션 정밀도 측면에서 어떻게 비교되는가?
- RQ5운동 기반 추적기가 실패하는 저프레임 레이트 조건에서도 프레임워크가 강력한 성능을 유지할 수 있는가?
주요 결과
- EfficientVIS는 추가 데이터나 다중 모델 앙상블 없이 YouTube-VIS 2019 및 2021 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
- VisTR 대비 훈련 시간을 15배 감소시켜 훨씬 적은 에포크 수로 수렴을 달성하였다.
- EfficientVIS는 VisTR 대비 AP75를 1.5%p 향상시키고, 재현율(AR)을 3.2%p 향상시켜 더 높은 마스크 정밀도와 가림된 물체 탐지 능력을 보였다.
- 프레임당 0.2 FPS(5초에 한 프레임)에서도 강력한 성능을 유지하여 저프레임 레이트 및 운동 흐림에 대한 강건성을 입증하였다.
- 다중 클립 설정에서 대응 학습은 수동으로 설계된 데이터 연동을 능가하며, YouTube-VIS 2019에서 AP가 2.1%p 높게 나타났다.
- ROI 기반 설계로 배경 간섭이 감소하고 마스크 품질이 향상되어, 더 빠른 수렴에도 불구하고 더 높은 정확도를 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.