Skip to main content
QUICK REVIEW

[논문 리뷰] Human Action Recognition without Human

Hirokatsu Kataoka, Hara, Kensho|arXiv (Cornell University)|2016. 08. 29.
Human Pose and Action Recognition참고 문헌 6인용 수 5
한 줄 요약

이 논문은 '인간 없이 인간 행동 인식'을 제안하여, 배경의 운동만으로도 UCF101에서 높은 분류 성능를 달성할 수 있음을 보여준다. 인간 영역을 검은 배경으로 대체하고 두 개의 스트림 컨볼루션 신경망을 사용함으로써, 이 방법은 47.42%의 정확도를 달성하였으며, 인간이 존재할 경우의 56.91% 성능에 비해 놀랍게 유사한 결과를 보였으며, 행동 인식에서 배경의 운동이 매우 강력한 분류 능력을 지닌다는 것을 시사한다.

ABSTRACT

The objective of this paper is to evaluate "human action recognition without human". Motion representation is frequently discussed in human action recognition. We have examined several sophisticated options, such as dense trajectories (DT) and the two-stream convolutional neural network (CNN). However, some features from the background could be too strong, as shown in some recent studies on human action recognition. Therefore, we considered whether a background sequence alone can classify human actions in current large-scale action datasets (e.g., UCF101). In this paper, we propose a novel concept for human action analysis that is named "human action recognition without human". An experiment clearly shows the effect of a background sequence for understanding an action label.

연구 동기 및 목표

  • 인간의 신체 운동에 의존하지 않고 배경 운동만을 사용하여 행동 인식이 가능할지 조사하기 위해.
  • UCF101과 같은 대규모 행동 인식 데이터셋에서 배경 시퀀스가 맥락적 단서로 기여하는 정도를 평가하기 위해.
  • 행동 인식에 인간의 운동이 필수적이라는 가정을 도전하기 위해 배경 전용 특징을 고립하고 분석하기 위해.
  • 표준화된 두 개의 스트림 컨볼루션 신경망 프레임워크를 사용하여 인간 존재 유무에 따른 인식 성능를 비교하기 위해.
  • 배경의 운동만으로도 행동 분류를 위한 강력한 분류 신호를 제공할 수 있음을 보여주기 위해.

제안 방법

  • 인간 영역을 검은 배경으로 대체하기 위해 중심 주변 이미지 필터링을 적용하여 영상 시퀀스에서 인간의 운동을 효과적으로 제거하기 위해.
  • 공간(외관) 및 시간(운동) 특징를 별도의 스트림으로 처리하기 위해 사전 학습된 매우 깊은 두 개의 스트림 컨볼루션 신경망을 특징 추출에 사용하기 위해.
  • 기존 UCF101 데이터셋을 사용하여 표준 두 개의 스트림 학습 방식으로 모델을 훈련한 후, 필터링된 배경 전용 시퀀스에서 성능를 평가하기 위해.
  • 인버스 필터링을 적용하여 인간 영역를 고립하고 인간 존재 유무에 따른 성능를 비교하기 위해.
  • 배경 전용 필터링을 위한 식 (1) 사용: $ I'(x,y) = I(x,y) * f(x,y) $, 여기서 $ f $ 는 인간 영역를 검은 색으로 대체한다.
  • 인간 전용 필터링을 위한 식 (2) 사용: $ \overline{I'}(x,y) = I(x,y) * \overline{f}(x,y) $, 여기서 $ \overline{f} $ 는 배경을 제거하여 인간 운동을 고립한다.

실험 결과

연구 질문

  • RQ1인간과 관련된 특징이 전혀 없이 배경 운동만으로도 행동 인식을 효과적으로 수행할 수 있는가?
  • RQ2전체 영상에서 학습한 경우와 배경 시퀀스만을 사용한 경우에 대해 두 개의 스트림 컨볼루션 신경망의 성능를 어떻게 비교할 수 있는가?
  • RQ3배경 전용 행동 인식에서 외관(공간) 특징와 운동(시간) 특징의 상대적 기여도는 어떠한가?
  • RQ4배경에서 온 맥락적 단서가 기준 데이터셋에서 행동 분류 정확도에 얼마나 큰 영향을 미치는가?
  • RQ5UCF101과 같은 대규모 데이터셋에서 배경 시퀀스만으로도 서로 다른 인간 행동 클래스를 구분하는 데에 충분한가?

주요 결과

  • 두 개의 스트림 컨볼루션 신경망은 배경 시퀀스만을 사용할 경우 UCF101 스플릿 1에서 47.42%의 정확도를 달성하여, 배경 운동만으로도 의미 있는 행동 인식이 가능하다는 것을 입증하였다.
  • 배경 전용 데이터에서 공간 스트림이 시간 스트림보다 유의미하게 높은 성능를 보였다(45.33% 대 26.80%), 이는 배경의 외관 단서가 운동 단서보다 더 강력한 분류 능력을 지닌다는 것을 시사한다.
  • 인간이 존재할 경우의 성능는 56.91%였으며, 이는 배경 전용 설정보다 9.49% 높은 성능를 보였다. 이는 인간 특징가 여전히 상당한 성능 향상 기여를 한다는 것을 보여준다.
  • 배경 전용 설정에서 공간 스트림이 시간 스트림보다 18.53%p 높은 성능를 보였으며, 이는 배경의 외관 패턴이 운동 동적 특성보다 더 정보가 많다는 것을 시사한다.
  • 배경 전용 설정에서 UCF101 스플릿 1 영상의 29.45%는 인간이 없는 부분 영역을 포함하고 있었으며, 전체적으로는 인간이 전혀 없는 영상은 없었으며, 이는 인간 존재가 일반적이지만 항상 필수적인 것은 아님을 시사한다.
  • 결과는 기존의 행동 인식에 대한 일반적인 가정을 도전하며, 인간의 운동이 없더라도 배경 시퀀스가 행동 분류에 충분한 맥락 정보를 지닌다는 것을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.