[논문 리뷰] Online Object Tracking, Learning and Parsing with And-Or Graphs
이 논문은 구조적 및 외관 변화를 모델링하기 위해 계층적 And-Or 그래프(AOGs)를 사용하는 새로운 온라인 객체 추적, 학습 및 구문 분석 프레임워크인 AOGTracker를 제안한다. 실시간 추론을 위해 공간적 및 시간적 동적 프rogramming을 활용하고, 가림, 조명 변화 및 간섭 요소에 대응하기 위해 판별적 잠재 SVM 학습을 적용하여 TB-100에서 최신 기술 수준의 성능을 달성했고, VOT 벤치마크(VOT2015 및 TIR2015 포함)에서도 경쟁력 있는 결과를 보였다.
This paper presents a method, called AOGTracker, for simultaneously tracking, learning and parsing (TLP) of unknown objects in video sequences with a hierarchical and compositional And-Or graph (AOG) representation. %The AOG captures both structural and appearance variations of a target object in a principled way. The TLP method is formulated in the Bayesian framework with a spatial and a temporal dynamic programming (DP) algorithms inferring object bounding boxes on-the-fly. During online learning, the AOG is discriminatively learned using latent SVM to account for appearance (e.g., lighting and partial occlusion) and structural (e.g., different poses and viewpoints) variations of a tracked object, as well as distractors (e.g., similar objects) in background. Three key issues in online inference and learning are addressed: (i) maintaining purity of positive and negative examples collected online, (ii) controling model complexity in latent structure learning, and (iii) identifying critical moments to re-learn the structure of AOG based on its intrackability. The intrackability measures uncertainty of an AOG based on its score maps in a frame. In experiments, our AOGTracker is tested on two popular tracking benchmarks with the same parameter setting: the TB-100/50/CVPR2013 benchmarks, and the VOT benchmarks --- VOT 2013, 2014, 2015 and TIR2015 (thermal imagery tracking). In the former, our AOGTracker outperforms state-of-the-art tracking algorithms including two trackers based on deep convolutional network. In the latter, our AOGTracker outperforms all other trackers in VOT2013 and is comparable to the state-of-the-art methods in VOT2014, 2015 and TIR2015.
연구 동기 및 목표
- 장기적인 온라인 객체 추적 과제를 외관 및 구조적 변형, 가림, 배경 혼잡성에 대응하여 해결하기 위해.
- 사전 학습된 모델 없이 영상 시퀀스에서 미지의 객체를 동시에 추적, 학습 및 구문 분석할 수 있는 통합 프레임워크를 개발하기 위해.
- AOG 구조 및 파rameter의 온라인 학습 중 모델의 순수성 유지 및 복잡도 제어를 위해.
- 모델 불확실성의 척도인 '추적 불가능성(Intrackability)'을 기반으로 AOG 구조 재학습을 위한 핵심 순간을 식별하기 위해.
- 구성적이고 계층적인 표현을 통해 최소한의 인간 감독으로도 복잡한 환경에서 견고한 추적을 가능하게 하기 위해.
제안 방법
- 프레임워크는 객체 구조 및 부분 구성 방식을 표현하기 위해 계층적 And-Or 그래프(AOG)를 사용하여 외관 및 구조적 변형을 구성적으로 모델링한다.
- 공간적 및 시간적 동적 프로그래밍(DP) 알고리즘을 활용해 실시간으로 객체 경계 상자 추론을 수행하며, 과거 및 현재 관측치를 통합하여 동시 최적 추론을 수행한다.
- 잠재 SVM를 사용해 AOG 파rameter의 판별적 학습을 수행하여 모델이 외관 변화, 가림 및 간섭 요소에 실시간으로 적응할 수 있도록 한다.
- 온라인 학습 중에 양성 및 음성 예측의 순수성을 유지하기 위해 순수성 제어 메커니즘을 적용하여 모델 열화를 방지한다.
- 정량화된 구성 공간에서 구분 능력이 떨어지는 부분 구성 방식을 제거함으로써 모델 복잡도를 제어한다.
- 점수 맵에서 계산된 '추적 불가능성(Intrackability)'을 사용해 불확실성을 감지하고 필요에 따라 구조적 재학습을 트리거한다.
실험 결과
연구 질문
- RQ1구성적 And-Or 그래프 표현이 장기 영상 추적에서 미지의 객체 변형을 효과적으로 모델링할 수 있는가?
- RQ2양성 및 음성 학습 예제의 순수성을 유지하면서 효율적인 온라인 학습을 수행할 수 있는가?
- RQ3동적 프로그래밍을 사용해 시간과 공간을 종합적으로 고려한 객체 상태 추론을 통해 추적 정확도를 향상시킬 수 있는가?
- RQ4온라인 잠재 구조 학습 중 모델 복잡도를 어떻게 제어할 수 있는가?
- RQ5추적 불가능성이 불확실성에 대응해 구조적 재학습을 트리거하는 신뢰할 수 있는 신호로 기능할 수 있는가?
주요 결과
- TB-100/50/CVPR2013 벤치마크에서 AOGTracker는 최신 기술 수준의 추적기들, 특히 두 가지 딥 러닝 기반 방법을 초월했다.
- VOT2013에서 AOGTracker는 가장 높은 정확도와 최고의 종합 순위를 기록했지만, 상위 세 개의 추적기들보다 약간 낮은 내구성은 보였다.
- VOT2014에서 AOGTracker는 최신 기술 수준의 추적기들과 유사한 성능을 보이며 다양한 시각적 과제에 대한 강력한 일반화 능력을 입증했다.
- VOT2015에서 AOGTracker는 51%의 정확도를 기록하여 총 62개의 추적기 중 세 번째로 높은 순위를 차지했다.
- 열화상 영상(VOT-TIR2015)에서 AOGTracker는 65%의 정확도를 기록하여 총 28개의 추적기 중 세 번째로 높은 순위를 기록했고, 동점이었다.
- 이 방법은 사전 학습된 모델에 의존하지 않으면서도 조명 변화, 부분적 가림 및 배경 혼잡성에 대해 견고한 성능를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.