[논문 리뷰] Human Action Recognition and Prediction: A Survey
이 설문조사는 비디오에서의 시각 기반 인간 행동 인식 및 예측의 최첨단 기법을 다루며, 표현 방식, 분류기, 데이터셋, 도전과제, 응용 및 향후 방향을 다룬다.
Derived from rapid advances in computer vision and machine learning, video analysis tasks have been moving from inferring the present state to predicting the future state. Vision-based action recognition and prediction from videos are such tasks, where action recognition is to infer human actions (present state) based upon complete action executions, and action prediction to predict human actions (future state) based upon incomplete action executions. These two tasks have become particularly prevalent topics recently because of their explosively emerging real-world applications, such as visual surveillance, autonomous driving vehicle, entertainment, and video retrieval, etc. Many attempts have been devoted in the last a few decades in order to build a robust and effective framework for action recognition and prediction. In this paper, we survey the complete state-of-the-art techniques in action recognition and prediction. Existing models, popular algorithms, technical difficulties, popular action databases, evaluation protocols, and promising future directions are also provided with systematic discussions.
연구 동기 및 목표
- 행동 인식 및 예측의 완전한 최첨단 기술들을 조사한다.
- 인식(현재 상태)과 예측(미래 상태) 간의 차이점과 유사점을 명확히 한다.
- 대표적인 데이터셋, 평가 프로토콜, 및 실제 응용을 논의한다.
- 주요 도전과제를 식별하고 향후 연구를 위한 유망한 방향을 제시한다.
제안 방법
- 행동 표현 접근법을 전체적(holistic) 및 국소적(local) 특징으로 구성하고 각각의 강점과 약점을 논의한다.
- 수작업(hand-crafted) 및 딥 러닝 기반 표현과 분류기를 검토한다.
- 직접형(direct), 순차적(sequential), 시공간(space-time), 부분 기반(part-based) 모델로 행동 분류기를 분류하고 엔드-투-엔드 딥 프레임워크를 포함한다.
- 데이터셋, 평가 프로토콜, 그리고 클래스 내 변이 및 클래스 간 변이와 같은 실용적 도전과제를 요약한다.
- 실세계 응용 및 향후 연구 방향을 강조한다.
실험 결과
연구 질문
- RQ1다양한 시점과 배경에서도 강건한 인식과 예측을 가능하게 하는 효과적인 행동 표현은 무엇인가?
- RQ2인식과 예측 작업이 데이터 요구사항과 시간적 모델링 측면에서 어떻게 다른가?
- RQ3현실 세계에서의 배치를 방해하는 주요 도전과제(변동성, 잡음, 데이터 주석)와 이를 어떻게 완화할 수 있는가?
- RQ4긴급 상황에서의 행동 예측을 진전시키는 데 가장 유망한 방향은 무엇인가(예: 자율주행)?
주요 결과
- 본 설문은 행동 인식 및 예측의 최첨단 기법을 통합하고 데이터셋, 프로토콜 및 도전과제를 논의한다.
- 완전한 행동을 인식하는 것과 불완전한 시퀀스로부터 행동을 예측하는 것 사이의 차이를 강조한다.
- 전체적, 국소적, 궤적 기반, 부분 기반 및 심층 학습 접근법에 이르기까지 광범위한 표현 및 분류기 계열을 조사한다.
- 감시, 비디오 검색, 엔터테인먼트, 인간-로봇 상호작용, 자율주행 등과 같은 실제 응용을 논의한다.
- 클래스 내/간 변이, 잡음, 카메라 움직임, 데이터 부족, 행동 어휘, 예측성의 불균형 등 주요 도전과제를 식별한다.
- 현재 연구의 유망한 향후 방향과 격차를 제시한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.