Skip to main content
QUICK REVIEW

[논문 리뷰] Human in Events: A Large-Scale Benchmark for Human-centric Video Analysis in Complex Events

Weiyao Lin, Huabin Liu|arXiv (Cornell University)|2020. 05. 09.
Human Pose and Action Recognition참고 문헌 44인용 수 67
한 줄 요약

HiEve는 혼잡하고 복잡한 이벤트에서 인체 중심 비디오 분석을 위한 대규모 계층적 데이터셋을 도입하며, 광범위한 포즈, 트래킹, 액션 주석과 교차 주석 기반 기준선 및 온라인 평가 서버를 제공합니다.

ABSTRACT

Along with the development of modern smart cities, human-centric video analysis has been encountering the challenge of analyzing diverse and complex events in real scenes. A complex event relates to dense crowds, anomalous individuals, or collective behaviors. However, limited by the scale and coverage of existing video datasets, few human analysis approaches have reported their performances on such complex events. To this end, we present a new large-scale dataset with comprehensive annotations, named Human-in-Events or HiEve (Human-centric video analysis in complex Events), for the understanding of human motions, poses, and actions in a variety of realistic events, especially in crowd & complex events. It contains a record number of poses (>1M), the largest number of action instances (>56k) under complex events, as well as one of the largest numbers of trajectories lasting for longer time (with an average trajectory length of >480 frames). Based on its diverse annotation, we present two simple baselines for action recognition and pose estimation, respectively. They leverage cross-label information during training to enhance the feature learning in corresponding visual tasks. Experiments show that they could boost the performance of existing action recognition and pose estimation pipelines. More importantly, they prove the widely ranged annotations in HiEve can improve various video tasks. Furthermore, we conduct extensive experiments to benchmark recent video analysis approaches together with our baseline methods, demonstrating HiEve is a challenging dataset for human-centric video analysis. We expect that the dataset will advance the development of cutting-edge techniques in human-centric analysis and the understanding of complex events. The dataset is available at http://humaninevents.org

연구 동기 및 목표

  • 혼잡한 장면에서 사람의 움직임, 자세, 동작에 초점을 맞춘 실제 세계의 복합 이벤트 대규모 데이터셋을 구축한다.
  • 다양한 비디오 이해 작업을 가능하게 하는 포즈, 추적, 동작 등 포괄적 주석을 제공한다.
  • 포즈 인식 기반의 동작 인식 및 동작 가이드 기반 포즈 추정 기준선을 설계해 교차 주석의 이점을 입증한다.
  • HiEve에서 최신 방법을 평가하여 난이도와 기준선의 영향을 규명한다.

제안 방법

  • 다양한 복합 이벤트를 포함한 12개의 실제 세계 장면을 큐레이션하고 총 49,820 프레임의 32개 비디오 시퀀스를 수집한다.
  • 각 인물에 대해 14개의 주요 포인트를 프레임마다 주석한다(코, 가슴, 어깨, 팔꿈치, 손목, 엉덩이, 무릎, 발목). 필요시 보이지 않는 핵심점을 포함하여.
  • 모든 개인에 대해 매 20프레임마다 14개 액션 카테고리를 주석하고, 그룹 액션은 모든 참가자를 주석 처리하여 처리한다.
  • 추적, 포즈 추정, 액션 인식을 가능하게 하는 밀도 높은 주석과 함께 평균 길이 >480 프레임의 긴 트라젝터리를 제공한다.
  • 크로스 어노테이션 정보를 활용한 두 가지 향상된 기준선을 개발한다: (i) 포즈 인식 기반의 액션 인식으로 포즈 특징을 RGB 기반 액션 모델에 통합하고, (ii) 액션 선행 정보를 사용하여 포즈를 정제하는 액션 주도 포즈 추정.
  • 보류된 테스트 비디오를 위한 평가 지표와 온라인 서버(HiEve 평가 서버)를 도입한다.

실험 결과

연구 질문

  • RQ1HiEve의 규모와 주석 다양성이 실제 세계 인체 중심 비디오 분석 방법의 견고한 평가와 개발을 어떻게 지원하는가?
  • RQ2교차 주석 정보(포즈, 트랙, 액션)가 혼잡하고 복잡한 이벤트에서 액션 인식 및 포즈 추정 성능을 향상시킬 수 있는가?
  • RQ3최신 방법들이 HiEve의 복잡한 장면에서 기존 벤치마크와 비교하여 어떤 성능을 보이는가?
  • RQ4HiEve가 포착한 장기 재식별과 혼잡한 장면 이해의 도전 과제는 무엇인가?

주요 결과

  • HiEve는 49,820 프레임, 1,099,357 포즈, 56,643 액션 인스턴스, 그리고 평균 길이 485 프레임인 2,687개의 긴 트라젝터리를 포함한다.
  • HiEve는 이전의 MOT 및 포즈 데이터셋보다 더 길고 더 붐비는 장면을 포착하여 복잡한 이벤트에서 추적 및 포즈 추정의 난이도가 증가함을 보여준다.
  • 교차 주석 기반 기준선(포즈 인식 기반의 액션 인식 및 액션 주도 포즈 추정)은 HiEve에서 기존 파이프라인의 성능을 향상시킨다.
  • HiEve의 다양한 주석과 도전적 시나리오는 현재 비디오 분석 접근법의 평가를 개선하며, 저자들은 확장 가능한 벤치마킹을 가능하게 하는 온라인 평가 서버를 제공한다.
  • HiEve는 현실적인 혼잡한 환경에서 인체 중심 비디오 분석을 발전시키기 위한 도전적인 벤치마크로 위치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.