Skip to main content
QUICK REVIEW

[논문 리뷰] Track Targets by Dense Spatio-Temporal Position Encoding

Jinkun Cao, Hao Wu|arXiv (Cornell University)|2022. 10. 17.
Video Surveillance and Tracking Methods인용 수 9
한 줄 요약

이 논문은 영상 다중객체 추적을 위한 트랜스포머에서 2D CNN 특징 맵에 직접 위치 인코딩을 적용하는 새로운 방법인 밀도 있는 시공간(Dense Spatio-Temporal, DST) 위치 인코딩을 제안한다. 이는 공간적 및 시간적 정보를 유지하면서 단일 프레임 검출과 궤적을 동일한 방식으로 표현할 수 있도록 하여, 외관 매칭을 초월한 목표물 연동 성능을 향상시킨다. 이로 인해 MOT 및 MOTS 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this work, we propose a novel paradigm to encode the position of targets for target tracking in videos using transformers. The proposed paradigm, Dense Spatio-Temporal (DST) position encoding, encodes spatio-temporal position information in a pixel-wise dense fashion. The provided position encoding provides location information to associate targets across frames beyond appearance matching by comparing objects in two bounding boxes. Compared to the typical transformer positional encoding, our proposed encoding is applied to the 2D CNN features instead of the projected feature vectors to avoid losing positional information. Moreover, the designed DST encoding can represent the location of a single-frame object and the evolution of the location of the trajectory among frames uniformly. Integrated with the DST encoding, we build a transformer-based multi-object tracking model. The model takes a video clip as input and conducts the target association in the clip. It can also perform online inference by associating existing trajectories with objects from the new-coming frames. Experiments on video multi-object tracking (MOT) and multi-object tracking and segmentation (MOTS) datasets demonstrate the effectiveness of the proposed DST position encoding.

연구 동기 및 목표

  • 시각 작업, 특히 다중객체 추적에서 표준 위치 인코딩의 한계를 해결하기 위해 공간적 및 시간적 정보를 효과적으로 유지할 수 있도록 하는 것.
  • 프레임 간에 일관된 표현을 가능하게 하는 통합적이고 밀도 높으며 미분 가능한 객체 위치 표현을 개발하는 것.
  • 2D CNN 특징 맵에 기반한 위치 인코딩을 트랜스포머의 특징 파ip라인 초기 단계에 통합하여 트랜스포머 기반 추적 모델의 성능을 향상시키는 것.
  • 위치 인코딩이 단순히 외관 유사성에 의존하는 것에서 벗어나 강력하고 학습 가능한 추적 신호로 기능할 수 있음을 입증하는 것.
  • 미래의 영상 객체 추적 연구를 위한 새로운 기준으로 DST 인코딩을 정립하는 것.

제안 방법

  • 2D CNN 특징 맵에 직접 작용하는 푸리에 기반의 밀도 있는 시공간 위치 인코딩을 제안하여 픽셀 수준의 공간적 및 시간적 순서를 유지한다.
  • 선형성과 균일성을 유지하도록 DST 인코딩을 설계하여, 프레임 간에 단일 프레임 검출과 변화하는 궤적을 일관되게 표현할 수 있도록 한다.
  • 트랜스포머의 자기주의 메커니즘에서 쿼리, 키, 밸류 투영에 DST 인코딩을 적용하여 위치에 대한 인도크티브 바이어스를 통합한다.
  • 세그멘테이션 또는 시각적 중요도 맵에서 유도된 어텐션 마스크를 도입하여 배경 노이즈를 억제하고 특징 표현 품질을 향상시킨다.
  • 새로운 검출을 기존 궤적과 연동할 수 있는 온라인 추론가능한 트랜스포머 기반 다중객체 추적 모델에 DST 인코딩을 통합한다.
  • 푸리에 주파수 성분을 활용한 학습 가능한 위치 임베딩을 사용하여 연속적인 공간적 및 시간적 위치를 미분 가능한 방식으로 근사한다.

실험 결과

연구 질문

  • RQ1밀도 있고 시공간적인 위치 인코딩은 외관 기반 연동을 초월하여 트랜스포머 기반 다중객체 추적 성능을 향상시킬 수 있는가?
  • RQ2표준 위치 인코딩이 영상 추적에서 성능이 떨어지는 이유는 무엇이며, 특징 맵에 더 이르게 적용함으로써 이러한 한계를 어떻게 보완할 수 있는가?
  • RQ3단일 프레임 검출과 다중 프레임 궤적을 일관되게 표현할 수 있는 통합 표현 형식을 설계할 수 있는가?
  • RQ4특징 파이프라인의 초기 단계에서 위치 정보를 더 이르게 통합하면, 외관 매칭에 의존하는 기존 방법에 비해 추적 성능이 향상되는가?
  • RQ5세그멘테이션 또는 시각적 중요도 맵 기반 어텐션 마스크의 사용이 특징 품질과 추적 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 DST 위치 인코딩은 MOTS20에서 HOTA 점수 51.9를 기록하여 기존 트랜스포머 기반 방법인 TransTrk(45.5) 및 MOTR(48.4)를 능가한다.
  • 모델은 MOTS20에서 IDF1 51.0을 달성하여 MOTA 기준으로는 최신 기술 수준인 OC-SORT(54.2)를 능가하지는 않지만, 더 견고한 위치 기반 연동 메커니즘을 제공한다.
  • 아블레이션 연구 결과, DST 인코딩을 제거하면 MOTS20-val에서 HOTA가 64.4로 떨어지며, 고전적 위치 인코딩을 사용할 경우 성능이 더욱 악화되어 64.1로 떨어지며 DST의 우수성을 입증한다.
  • 어텐션 마스크를 적용하면 HOTA가 64.6에서 67.1로 향상되며, 배경 노이즈를 효과적으로 걸러내고 특징 품질을 향상시킨다는 것을 보여준다.
  • ID 스위치 수는 인코딩 없이 150에서 DST 인코딩을 사용할 경우 135로 감소하여 궤적 일관성이 향상됨을 보여준다.
  • 아블레이션 분석을 통해 DST 인코딩이 성능 향상의 주요 기여 요소임을 확인하였으며, 어텐션 마스크는 추가적인 보조적 향상 기여를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.