Skip to main content
QUICK REVIEW

[논문 리뷰] Ego2Top: Matching Viewers in Egocentric and Top-view Videos

Shervin Ardeshir, Ali Borji|arXiv (Cornell University)|2016. 07. 24.
Video Analysis and Summarization참고 문헌 18인용 수 11
한 줄 요약

이 논문은 시각적 콘텐츠 변화와 다각도 간 관계를 모델링하여 일인칭 시각 영상 기록을 상향 시각 감시 영상의 해당 개인과 연결하는 스펙트럼 그래프 매칭 프레임워크인 Ego2Top을 제안한다. 단일 특징(Gist 및 Top-FOV)과 쌍별 특징(시간적 시각적 관계)을 결합함으로써, 그래프 구조와 시간적 동적 특성을 활용하여 일인칭 시청자와 상향 시각 영상 내 신원 간의 높은 할당 정확도를 달성한다. 이는 기존의 기준보다 뛰어난 성능을 발휘한다.

ABSTRACT

Egocentric cameras are becoming increasingly popular and provide us with large amounts of videos, captured from the first person perspective. At the same time, surveillance cameras and drones offer an abundance of visual information, often captured from top-view. Although these two sources of information have been separately studied in the past, they have not been collectively studied and related. Having a set of egocentric cameras and a top-view camera capturing the same area, we propose a framework to identify the egocentric viewers in the top-view video. We utilize two types of features for our assignment procedure. Unary features encode what a viewer (seen from top-view or recording an egocentric video) visually experiences over time. Pairwise features encode the relationship between the visual content of a pair of viewers. Modeling each view (egocentric or top) by a graph, the assignment process is formulated as spectral graph matching. Evaluating our method over a dataset of 50 top-view and 188 egocentric videos taken in different scenarios demonstrates the efficiency of the proposed approach in assigning egocentric viewers to identities present in top-view camera. We also study the effect of different parameters such as the number of egocentric viewers and visual features.

연구 동기 및 목표

  • 일인칭 시각 영상과 상향 시각 영상 간의 교차 시점 대응이 부족한 문제를 해결하고자 하며, 이는 감시 및 활동 분석에서 상호 보완적인 성질을 지닌다.
  • 직접적인 외관적 단서 없이도 일인칭 카메라 사용자가 상향 시각 카메라에 보이는 어느 사람과 대응되는지 식별하고자 한다.
  • 다른 카메라 시점 간에 시각적 콘텐츠와 시간적 관계를 활용해 시청자 신원을 추론하는 견고한 프레임워크를 개발하고자 한다.
  • 일인칭 카메라 수의 변화에 따라 단일 특징과 쌍별 특징이 할당 정확도에 미치는 영향을 평가하고자 한다.

제안 방법

  • 각 일인칭 영상과 상향 시각 시청자를 그래프의 노드로 표현하고, 이들의 시각적 콘텐츠를 단일 특징(Gist 및 Top-FOV 기술자)으로 인코딩한다.
  • 일인칭 영상 콘텐츠의 시간적 시각 유사도를 활용해 시청자 간의 쌍별 관계를 모델링하여 그래프의 간선을 형성한다.
  • 단일 특징과 쌍별 특징을 기반으로 유사도 행렬을 계산함으로써 매칭 문제를 스펙트럼 그래프 매칭으로 공식화한다.
  • 스펙트럼 근사법을 사용해 일인칭 및 상향 시각 그래프 간의 소프트 할당을 계산한 후, 하드 할당을 위해 허그리안 이분할 매칭을 적용한다.
  • 궤적을 기반으로 시청자 방향과 Top-FOV(상향 시각 시야)를 추정하여 일인칭 시각 콘텐츠를 상향 시각 콘텐츠와 정렬한다.
  • 다중 객체 추적을 적용하여 상향 시각 궤적을 추출하고, 이를 Top-FOV 추정 및 특징 계산의 입력으로 사용한다.

실험 결과

연구 질문

  • RQ1외관적 단서에 의존하지 않고 일인칭 영상 콘텐츠를 상향 시각 감시 영상의 신원과 효과적으로 매칭할 수 있는가?
  • RQ2단일 시각적 특징(Gist, Top-FOV 등)과 시청자 간의 쌍별 관계는 매칭 정확도에 어떻게 기여하는가?
  • RQ3사용 가능한 일인칭 영상 수가 시청자 매칭 성능에 미치는 영향은 어떠한가?
  • RQ4단일 특징과 쌍별 특징을 모두 활용한 스펙트럼 그래프 매칭이 단일 특징 또는 무작위 할당을 사용하는 기준보다 우월한가?
  • RQ5일인칭 영상의 완전성 비율(n_Ego / n_Top)이 할당 및 랭킹 정확도에 어떤 영향을 미치는가?

주요 결과

  • 스펙트럼 그래프 매칭(GM)에서 단일 특징과 쌍별 특징을 모두 사용한 제안된 방법은 기준보다 뚜렷이 뛰어난 성능을 보이며, 무작위 할당 또는 단일 특징만 사용하는 방법보다 높은 할당 정확도를 달성한다.
  • 그래프 매칭 점수는 상향 시각 영상과 시청자를 랭킹하는 데 의미 있는 기준이 되며, 그림 7(a)의 빨간 선은 단일 특징만 사용하는 방법보다 향상된 누적 매칭 정확도를 보여준다.
  • 완전성 비율(n_Ego / n_Top)이 높을수록 하드 할당 정확도가 증가하여, 더 많은 일인칭 영상이 그래프 구조와 매칭 신뢰도를 향상시킨다는 점을 입증한다.
  • 쌍별 특징은 정확도에 상당한 기여를 하며, 그림 7(c)에서 GM이 단일 특징 전용 기준(H 및 G-F)보다 일관되게 향상된 성능을 보인다.
  • 본 방법은 다양한 시나리오에서 일인칭 시청자를 상향 시각 영상 내에서 성공적으로 식별하며, 50개의 상향 시각 영상과 188개의 일인칭 영상에 대한 평가를 통해 강인성과 확장성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.