Skip to main content
QUICK REVIEW

[논문 리뷰] Ego-Downward and Ambient Video based Person Location Association

Liang Yang, Hao Jiang|arXiv (Cornell University)|2018. 12. 02.
Video Surveillance and Tracking Methods참고 문헌 28인용 수 4
한 줄 요약

이 논문은 에고-하향 및 제3인칭 정적 카메라 뷰를 사용하여 크로스뷰 개인 현지화 및 추적을 위한 새로운 동작 및 운동 특징 기반 모델을 제안한다. 3D 자세 추정과 시간-공간 정렬을 활용하여, 기준 모델 대비 18.32% 높은 정확도를 달성하였으며, 다수의 개인이 있는 상황에서 74.22%의 검증 정확도와 평균 67.767%의 정확도를 기록하여, 가림과 유사한 외관에 대해 강건함을 입증한다.

ABSTRACT

Using an ego-centric camera to do localization and tracking is highly needed for urban navigation and indoor assistive system when GPS is not available or not accurate enough. The traditional hand-designed feature tracking and estimation approach would fail without visible features. Recently, there are several works exploring to use context features to do localization. However, all of these suffer severe accuracy loss if given no visual context information. To provide a possible solution to this problem, this paper proposes a camera system with both ego-downward and third-static view to perform localization and tracking in a learning approach. Besides, we also proposed a novel action and motion verification model for cross-view verification and localization. We performed comparative experiments based on our collected dataset which considers the same dressing, gender, and background diversity. Results indicate that the proposed model can achieve $18.32 \%$ improvement in accuracy performance. Eventually, we tested the model on multi-people scenarios and obtained an average $67.767 \%$ accuracy.

연구 동기 및 목표

  • GPS가 사용 불가능한 환경(예: 실내 또는 도심 지역)에서 시각적 특징이 제한된 조건에서 개인 현지화 및 추적 문제를 해결하기 위해.
  • 저조도 또는 가림이 있는 환경에서 전통적인 특징 기반 추적의 실패를 운동 및 동작 신호를 활용하여 극복하기 위해.
  • 제한된 시야 및 자세 변동성으로 인해 본질적으로 도전적인 에고-하향 및 제3인칭 정적 카메라 뷰 간의 크로스뷰 검증을 향상시키기 위해.
  • 실세계 환경에서 다양한 외관, 배경 및 운동 패턴에 일반화되는 강력한 학습 기반 시스템을 개발하기 위해.

제안 방법

  • 에고-하향 및 제3인칭 뷰 영상 시퀀스 간 연속적인 개인 탐지를 유지하기 위해 YOLO 기반 추적기를 사용한다.
  • 공간 정렬 및 운동 모델링을 가능하게 하기 위해 에고 뷰 및 제3인칭 뷰 데이터에서 3D 인간 자세 추정을 수행한다.
  • 자세 및 운동을 핵심 신호로 사용하여 크로스뷰 검증을 위한 동작 및 운동 특징을 학습하기 위해 시간-공간 동시 시아네스 네트워크를 설계한다.
  • 에고 뷰의 운동 및 이동 특징과 제3인턴스 뷰의 오도메트리 정보를 융합하여 다중 모odal 특징 융합을 통해 정확도를 향상시킨다.
  • 특히 다수의 개인이 존재하거나 교차하는 상황에서 검증 결과를 개선하기 위해 속도 예측 기능을 갖춘 베이즈 필터를 적용한다.
  • 단기 영상 클립을 온라인으로 처리함으로써, 뷰 간 기하학적 및 운동 일관성을 활용하여 실시간 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1유사한 옷차림이나 가림으로 인해 시각적 외관이 신뢰할 수 없을 때, 동작 및 운동 특징만으로도 정확한 크로스뷰 개인 현지화가 가능한가?
  • RQ23D 자세 추정의 통합이 에고-하향 및 제3인칭 카메라 뷰 간 정렬 및 검증에 어떻게 기여하는가?
  • RQ3에고 뷰의 운동과 제3인턴스 뷰의 오도메트리 중 어느 것이 정확도 향상에 더 큰 기여를 하는가?
  • RQ4다수의 개인 상호작용 및 신체 자세 유사성과 같은 도전적인 조건에서 모델의 성능은 어떠한가?
  • RQ5시각적 맥락에 의존하지 않고도 다양한 배경, 옷차림 및 운동 패턴에 일반화되는가?

주요 결과

  • 제안된 ETVVT 모델은 74.22%의 검증 정확도를 달성하여 기준 모델 대비 18.32% 향상된 성능을 보였다.
  • 동작 모델은 운동 모델보다 높은 정확도를 기록하여 72.5% 대비 70.03%를 기록하였으며, 이는 자세 기반의 동작 인식이 운동 특징만을 사용하는 것보다 더 구분력이 높다는 것을 시사한다.
  • 제3인턴스 뷰의 이동 특징이 검증 정확도를 79.05%에서 81.80%로 향상시켜, 제3인턴스 뷰의 운동 신호가 에고 뷰 오도메트리보다 더 신뢰할 수 있음을 보여준다.
  • 다수의 개인이 존재하는 상황에서 평균 정확도는 67.767%였으며, 교차가 없는 경우 성능이 높고, 그룹이 교차할 경우 부분적인 가림으로 인해 정확도가 낮아졌다.
  • 베이즈 필터는 저복잡도 상황에서 성능을 크게 향상시켜, 이중 비교에서 최대 96.17%의 정확도를 달성하였다.
  • 여러 사람이 동일한 동작과 외관을 가진 경우 모델이 실패함을 확인하여, 동일한 운동 패턴을 구분하는 데 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.