[논문 리뷰] On Duality Of Multiple Target Tracking and Segmentation
이 논문은 라그랑주 이중 분해를 사용하여 온라인 다중 타깃 트래킹과 비디오 오브제クト 세그멘테이션을 동시에 해결하는 이중 최적화 프레임워크를 제안한다. 이로 인해 상호 보완적 개선이 가능해지며, 세그멘테이션은 정밀한 포어그라운드 마스크를 제공하여 트래킹의 드리프트와 ID 스위치를 줄이고, 트래킹은 시간적 일관성으로 세그멘테이션을 안내한다. 이 방법은 여러 벤치마크에서 두 작업 모두 최신 기술 수준의 성능을 달성한다.
Traditionally, object tracking and segmentation are treated as two separate problems and solved independently. However, in this paper, we argue that tracking and segmentation are actually closely related and solving one should help the other. On one hand, the object track, which is a set of bounding boxes with one bounding box in every frame, would provide strong high-level guidance for the target/background segmentation task. On the other hand, the object segmentation would separate object from other objects and background, which will be useful for determining track locations in every frame. We propose a novel framework which combines online multiple target tracking and segmentation in a video. In our approach, the tracking and segmentation problems are coupled by Lagrange dual decomposition, which leads to more accurate segmentation results and also \emph{helps resolve typical difficulties in multiple target tracking, such as occlusion handling, ID-switch and track drifting}. To track targets, an individual appearance model is learned for each target via structured learning and network flow is employed to generate tracks from densely sampled candidates. For segmentation, multi-label Conditional Random Field (CRF) is applied to a superpixel based spatio-temporal graph in a segment of video to assign background or target labels to every superpixel. The experiments on diverse sequences show that our method outperforms state-of-the-art approaches for multiple target tracking as well as segmentation.
연구 동기 및 목표
- 트래킹에서의 굵은 바운딩 박스로 인해 특징 오염과 드리프트가 발생하는 문제를 해결하기 위해 트래킹과 세그멘테이션을 별도로 다루는 데서 비롯되는 한계를 해결한다.
- 객체 트랙(바운딩 박스)과 픽셀 수준의 세그멘테이션 간의 강력한 상관관계를 활용하여 두 작업을 동시에 향상시킨다.
- 차폐, ID 스위치, 트랙 드리프트와 같은 일반적인 트래킹 과제를 픽셀 수준의 세그멘테이션을 감독 신호로 삼음으로써 해결한다.
- 이중 분해를 통해 트래킹과 세그멘테이션을 결합하는 통합 최적화 프레임워크를 개발하여 반복적 개선을 가능하게 한다.
- 사전 학습된 검출기 의존 없이 온라인 엔드 투 엔드 성능을 달성하기 위해 구조적 학습을 사용해 적응형 외관 모델을 개발한다.
제안 방법
- 라그랑주 이중 분해를 사용하여 트래킹과 세그멘테이션 하위 문제를 결합하고, 이중 변수를 통해 바운딩 박스와 픽셀 레이블 간의 일관성을 강제한다.
- 트래킹을 위해 구조적 학습을 통해 각 타깃별 개별적인 판별적 외관 모델을 학습하고, 밀집 샘플링된 후보자들에 대한 네트워크 플로우를 사용해 트랙을 생성한다.
- 세그멘테이션을 위해 각 타깃별로 포어그라운드 GMM을 구성하고, 통합 배경 GMM을 만들어 신뢰도 맵을 생성한 후, 슈퍼픽셀 기반의 시공간 그래프에 다중 레이블 CRF를 적용한다.
- 두 하위 문제를 반복적으로 최적화한다: 세그멘테이션은 픽셀 수준의 레이블을 통해 트랙 제안을 정밀화하고, 트래킹은 일관된 바운딩 박스 제약 조건을 통해 세그멘테이션을 향상시킨다.
- 온라인 학습을 사용해 추론 중 외관 모델을 적응시켜 외관 변화와 차폐에 대한 내구성을 확보한다.
- 일부 경우에 인간이 제공한 검출기를 초기화에 사용하지만, 공동 최적화를 통해 자동으로 타깃을 탐지할 수 있도록 한다.
실험 결과
연구 질문
- RQ1트래킹과 세그멘테이션을 별도로 해결하는 것보다, 둘을 함께 최적화하면 두 작업의 성능 향상이 가능한가?
- RQ2픽셀 수준의 세그멘테이션 결과는 차폐 중 ID 스위치와 드리프트와 같은 트래킹 오류를 어떻게 줄일 수 있는가?
- RQ3트래킹 제약 조건은 비디오 세그멘테이션의 정확도와 시간적 일관성에 얼마나 기여하는가?
- RQ4사전 학습된 검출기가 필요 없이도 이중 분해가 트래킹과 세그멘테이션을 효과적으로 결합할 수 있는가?
- RQ5粗모양의 바운딩 박스 트래킹과 세밀한 픽셀 수준의 세그멘테이션 간의 상호 보완적 개선이 어려운 시퀀스에서 더 나은 일반화 성능을 이끌어낼 수 있는가?
주요 결과
- 제안된 방법은 PETS-S2L1, TUD-Crossing, TUD-Stadtmitte에서 다중 타깃 트래킹과 비디오 오브제кт 세그멘테이션 모두 최신 기술 수준의 성능을 달성하여 이전 방법들을 능가한다.
- PETS-S2L1 데이터셋에서 MOTA 92.5와 IDS 0을 기록하여 이전 트래커들을 크게 능가하고, ID 스위치를 크게 감소시켰다.
- TUD-Crossing에서 MOTA 91.7과 IDS 0을 달성하여 복잡한 시나리오와 차폐에 대한 강건성을 입증했다.
- TUD-Stadtmitte에서 MOTA 83.8과 IDS 0을 기록하여 붐비는 환경에서도 뛰어난 성능을 보였다.
- 공동 최적화로 트랙 드리프트와 ID 스위치를 줄여, 차폐 중에도 정체성 일관성을 유지하는 데 세그멘테이션을 활용했다.
- 절단 분석 결과, 세그멘테이션을 통합함으로써 트래킹 전용 베이스라인(Ours-Track)의 성능이 크게 향상되었으며, 두 작업 간 상호 보완적 이점이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.