Skip to main content
QUICK REVIEW

[논문 리뷰] Skeleton Boxes: Solving skeleton based action detection with a single deep convolutional neural network

Bo Li, Huahui Chen|arXiv (Cornell University)|2017. 04. 19.
Human Pose and Action Recognition참고 문헌 10인용 수 10
한 줄 요약

이 논문은 3D 스켈레톤 시퀀스를 변환 및 척도에 영향을 받지 않는 색상 이미지로 매핑한 후, 수정된 SSD 프레임워크를 적용하여 정확하고 효율적인 검출을 수행하는 새로운 엔드 투 엔드 딥 컨volution 네트워크인 Skeleton Boxes를 제안한다. 이는 PKU-MMD 데이터셋에서 최신 기술 수준을 크게 뛰어넘는 성능을 기록하며, 크로스뷰 평가 시 mAP 0.945, 크로스서브젝트 평가 시 mAP 0.613를 달성한다.

ABSTRACT

Action recognition from well-segmented 3D skeleton video has been intensively studied. However, due to the difficulty in representing the 3D skeleton video and the lack of training data, action detection from streaming 3D skeleton video still lags far behind its recognition counterpart and image based object detection. In this paper, we propose a novel approach for this problem, which leverages both effective skeleton video encoding and deep regression based object detection from images. Our framework consists of two parts: skeleton-based video image mapping, which encodes a skeleton video to a color image in a temporal preserving way, and an end-to-end trainable fast skeleton action detector (Skeleton Boxes) based on image detection. Experimental results on the latest and largest PKU-MMD benchmark dataset demonstrate that our method outperforms the state-of-the-art methods with a large margin. We believe our idea would inspire and benefit future research in this important area.

연구 동기 및 목표

  • 스트리밍 3D 스켈레톤 영상에서 스켈레톤 기반 행동 검출을 위한 효과적이고 엔드 투 엔드 딥 러닝 프레임워크의 부족을 해결한다.
  • 3D 스켈레톤 데이터의 표현 및 검출 작업을 위한 훈련 데이터 부족 문제를 극복한다.
  • 이미지 기반 객체 검출과 스켈레톤 기반 행동 검출 간 격차를 해소하기 위해 SSD를 스켈레톤 매핑 이미지에 적응시킨다.
  • 스켈레톤의 시간적 및 공간적 운동 특성을 유지하는 변환 및 척도에 영향을 받지 않는 이미지 매핑 방법을 개발한다.
  • 슬라이딩 윈도우나 영역 제안 없이도 높은 검출 정확도와 계산 효율성을 달성한다.

제안 방법

  • 관절의 x, y, z 좌표를 R, G, B 채널에 할당하여 3D 스켈레톤 시퀀스를 색상 이미지로 매핑하고, 시간 순서를 유지한다.
  • 변환 및 척도에 영향을 받지 않는 정규화를 적용한다: $ p^{jk} = \text{floor}\left(255 \cdot \frac{c^{jk} - c^{jk}_{\text{min}}}{\max_k(c^{jk}_{\text{max}} - c^{jk}_{\text{min}})} \right) $, 여기서 정규화는 전체 데이터셋을 기준으로 하는 것이 아니라 시퀀스별로 수행된다.
  • 고해상도 비율의 행동 클립을 처리하기 위해 고유한 아웃라인 상자(기본 박스)를 사용하는 수정된 SSD 객체 검출 프레임워크를 스켈레톤 매핑 이미지에서 행동 인스턴스를 검출하는 데 적응한다. 아웃라인 상자의 종횡비는 $ \frac{1}{7}, \frac{1}{5}, \frac{1}{3}, \frac{1}{2}, 1, 2, 3, 5, 7 $이다.
  • 다양한 지속 시간과 공간 범위를 가진 행동을 검출하기 위해 다양한 척도와 종횡비를 가진 다중 척도 특징 맵을 사용한다.
  • 합성 손실을 사용하여 네트워크를 훈련한다: $ L(x,c,l,g) = \frac{1}{N}(L_{\text{conf}}(x,c) + \alpha L_{\text{loc}}(x,l,g)) $, 위치 예측에는 스무쓰 L1 손실, 분류에는 소프트맥스를 사용한다.
  • 훈련 중 하드 음성 마이닝(음성 대 양성 비율 3:1)과 무작위 패치 샘플링을 통한 데이터 증강 기법을 적용한다.

실험 결과

연구 질문

  • RQ1영역 제안 없이도 슬라이딩 윈도우 없이 엔드 투 엔드로 스켈레톤 기반 행동 검출을 위한 단일 딥 CNN을 효과적으로 훈련시킬 수 있는가?
  • RQ23D 스켈레톤 시퀀스를 시간적 및 공간적 운동 패턴을 유지하는 이미지 유사 표현으로 효과적으로 인코딩할 수 있는가?
  • RQ3특히 행동 클립의 높은 종횡비를 고려할 때, SSD 프레임워크가 스켈레톤 매핑 이미지에서 행동을 검출하는 데 얼마나 잘 적응될 수 있는가?
  • RQ4변환 및 척도에 영향을 받지 않는 이미지 매핑 전략이 스켈레톤 기반 행동 검출의 일반화 능력과 강건성에 기여하는가?
  • RQ5통합된 엔드 투 엔드 프레임워크가 대규모 스켈레톤 검출 벤치마크에서 기존의 이단계 또는 RNN 기반 방법을 능가할 수 있는가?

주요 결과

  • 제안된 Skeleton Boxes 방법은 PKU-MMD 데이터셋의 크로스뷰 평가에서 mAP 0.945, 크로스서브젝트 평가에서 mAP 0.613를 기록하여 이전 최신 기술 수준 방법을 크게 뛰어넘었다.
  • 크로스뷰 분할에서, 이전 최고 성능 방법(JCRRNN: 0.699 대비 0.945)보다 mAP가 25퍼센트 포인트 이상 향상되어 뚜렷한 우월성을 입증했다.
  • 크로스서브젝트 평가에서는 다음 최고 성능 방법(JCRRNN: 0.452 대비 0.613)을 16.1퍼센트 포인트 이상 앞서며 상당한 성능 향상을 보였다.
  • 변환 및 척도에 영향을 받지 않는 이미지 매핑 전략은 전반적인 3D 좌표 이동 및 척도 변화의 영향을 효과적으로 제거하여 모델의 강건성을 향상시켰다.
  • 특수 설계된 기본 박스(매우 높은 종횡비 포함)를 사용해 SSD를 스켈레톤 매핑 이미지에 적응시킴으로써 장기 지속 행동 클립의 정확한 검출이 가능해졌다.
  • 하드 음성 마이닝과 데이터 증강 기법을 통한 엔드 투 엔드 훈련은 제한된 훈련 데이터 조건에서도 안정적인 수렴과 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.