Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-temporal Person Retrieval via Natural Language Queries

Masataka Yamaguchi, Kuniaki Saito|arXiv (Cornell University)|2017. 04. 26.
Human Pose and Action Recognition참고 문헌 38인용 수 7
한 줄 요약

이 논문은 자연어 쿼리를 사용하여 다수의 비디오에서 사람을 위치 파악하는 공간-시간(person) 검색 시스템을 제안한다. 결과로는 튜브(경계 상자 시퀀스)를 출력한다. 13.7시간 분량의 비디오, 62,627개의 경계 상자, 30,365개의 설명을 포함하는 새로운 데이터셋을 제안하고, 공간-시간 검출과 다중모달 임베딩을 조합한 모델을 제시하여 뛰어난 성능과 클립 검색 및 동작 검출 작업으로의 일반화 능력을 확보하였다.

ABSTRACT

In this paper, we address the problem of spatio-temporal person retrieval from multiple videos using a natural language query, in which we output a tube (i.e., a sequence of bounding boxes) which encloses the person described by the query. For this problem, we introduce a novel dataset consisting of videos containing people annotated with bounding boxes for each second and with five natural language descriptions. To retrieve the tube of the person described by a given natural language query, we design a model that combines methods for spatio-temporal human detection and multimodal retrieval. We conduct comprehensive experiments to compare a variety of tube and text representations and multimodal retrieval methods, and present a strong baseline in this task as well as demonstrate the efficacy of our tube representation and multimodal feature embedding technique. Finally, we demonstrate the versatility of our model by applying it to two other important tasks.

연구 동기 및 목표

  • 자신의 참조 이미지 없이 자연어 기술만으로 다수의 비디오에서 특정 사람을 검색하는 문제에 대응하기 위해.
  • 기술효과로 기술된 사람의 공간-시간 경로를 나타내는 튜브(경계 상자 시퀀스)를 출력하는 시스템을 개발하기 위해.
  • 이 작업을 평가하기 위해 밀도 있는 시간적 태깅과 자연어 기술을 포함한 대규모이고 다양한 데이터셋을 구축하기 위해.
  • 다중모달 특징 임베딩과 튜브 표현을 활용하여 공간-시간 person 검색에 강력한 베이스라인을 수립하기 위해.
  • 클립 검색 및 공간-시간 동작 검출과 같은 관련 작업에 모델를 적용하여 그 유연성을 입증하기 위해.

제안 방법

  • 모델은 먼저 CNN 기반의 공간-시간 인간 검출 방법을 사용하여 후보 튜브를 생성한다.
  • 비디오 프레임에서 추출한 외관, 운동, 공간-시간 특징의 조합을 통해 튜브를 표현한다.
  • 텍스트 쿼리는 딥 네트워크를 사용하여 문맥 임베딩을 생성한다.
  • 다중모달 특징 임베딩 기법을 통해 튜브와 텍스트 표현을 공유된 임베딩 공간에서 정렬하여 검색한다.
  • 쿼리와 튜브 간의 매칭 점수는 학습된 관련성 함수를 사용하여 계산되며, 상위-K개의 튜브가 검색된다.
  • 클립 검색 및 동작 검출 작업에서는 클립 내에서 튜브 수준의 점수 중 최댓값을 클립 수준의 매칭 점수로 사용한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 참조 이미지 없이 자연어 기술 뿐만으로 다수의 비디오에서 사람을 효과적으로 검색할 수 있는가?
  • RQ2다양한 튜브 및 텍스트 표현 방식이 공간-시간 person 검색 작업의 성능에 어떤 영향을 미치는가?
  • RQ3제안된 다중모달 특징 임베딩 기법이 텍스트 쿼리와 사람 튜브 간의 교차 모달 정렬을 향상시키는가?
  • RQ4한 데이터셋에서 학습된 모델이 클립 검색 및 동작 검출과 같은 다른 비디오 이해 작업으로 일반화 가능한가?
  • RQ5제안된 방법이 새로운 데이터셋에서 강력한 베이스라인과 비교해 성능가능한가?

주요 결과

  • 제안된 방법은 클립 검색 작업에서 R@1이 0.415를 기록하여 베이스라인 방법(0.373)을 능가하여 클립 수준의 검색에 효과적임을 입증하였다.
  • 공간-시간 person 검색 작업에서 최신 기술 수준의 성능을 달성하였으며, 철저한 추상화 분석을 통해 강력한 베이스라인을 확립하였다.
  • fine-tuning 없이 UCF Sports 데이터셋에서 '달리기' 및 '들기'와 같은 동작 인스턴스를 성공적으로 탐지하여 강력한 제로샷 일반화 능력을 보였다.
  • 튜브 표현 방식과 다중모달 특징 임베딩의 사용은 다른 설정 대비 검색 정확도 향상에 크게 기여하였다.
  • ActivityNet 기반 데이터셋에서의 정성적 결과를 통해 다양한 동작과 환경에서도 성능가능성이 뛰어나다는 것이 입증되었다.
  • 모델의 아키텍처는 주요 검색 작업 외에도 관련 작업에 직접 적용 가능함을 확인하여 그 유연성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.