Skip to main content
QUICK REVIEW

[논문 리뷰] RGB Video Based Tennis Action Recognition Using a Deep Weighted Long Short-Term Memory.

Jiaxin Cai, Xin Tang|arXiv (Cornell University)|2018. 08. 02.
Human Pose and Action Recognition참고 문헌 11인용 수 4
한 줄 요약

이 논문은 사전 훈련된 Inception CNN 특징과 결합된 깊이 있는 가중치가 부여된 장단기 기억(LSTM) 네트워크를 사용하여 RGB 영상 기반 테니스 동작 인식 방법을 제안한다. 개별 프레임의 공간적 CNN 표현과 시간적 의존성을 모델링하기 위해 점수 가중치가 부여된 LSTM 디코더를 활용함으로써, 원시 RGB 영상 입력만을 사용하여 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Action recognition has attracted increasing attention from RGB input in computer vision partially due to potential applications on somatic simulation and statistics of sport such as virtual tennis game and tennis techniques and tactics analysis by video. Recently, deep learning based methods have achieved promising performance for action recognition. In this paper, we propose weighted Long Short-Term Memory adopted with convolutional neural network representations for three dimensional tennis shots recognition. First, the local two-dimensional convolutional neural network spatial representations are extracted from each video frame individually using a pre-trained Inception network. Then, a weighted Long Short-Term Memory decoder is introduced to take the output state at time t and the historical embedding feature at time t-1 to generate feature vector using a score weighting scheme. Finally, we use the adopted CNN and weighted LSTM to map the original visual features into a vector space to generate the spatial-temporal semantical description of visual sequences and classify the action video content. Experiments on the benchmark demonstrate that our method using only simple raw RGB video can achieve better performance than the state-of-the-art baselines for tennis shot recognition.

연구 동기 및 목표

  • 원시 RGB 영상 입력만을 사용하여 테니스 영상에서의 동작 인식을 향상시키기 위해.
  • 정확한 샷 분류를 위해 영상 시퀀스에서 장거리 시간적 의존성을 모델링하는 과제를 해결하기 위해.
  • 공간적 특징과 순차적 역학을 모두 포착하는 공간-시간 표현 학습 프레임워크를 개발하기 위해.
  • 기존 최신 기술 수준의 방법들에 비해 벤치마크 데이터셋에서 뛰어난 성능을 달성하기 위해.

제안 방법

  • 2차원 CNN 표현을 위해 사전 훈련된 Inception 네트워크를 사용하여 각 영상 프레임에서 공간적 특징을 추출한다.
  • 현재 상태와 이전 임bedding을 사용하여 맥락 인식 특징 벡터를 생성하는 가중치가 부여된 장단기 기억(LSTM) 디코더를 적용한다.
  • 시퀀스 모델링 중에 이전 은닉 상태에 대한 중요도를 동적으로 할당하기 위해 점수 가중치 부여 방식을 적용한다.
  • CNN과 가중치가 부여된 LSTM 아키텍처를 통합하여 시각적 특징을 공동의 공간-시간 벡터 공간으로 매핑하여 동작 분류를 수행한다.
  • 원시 RGB 영상 시퀀스를 기반으로 3차원 테니스 샷을 분류하기 위해 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1CNN 특징와 함께 가중치가 부여된 LSTM는 테니스 영상 시퀀스에서의 시간적 역학을 효과적으로 모델링할 수 있는가?
  • RQ2제안된 방법은 RGB 영상 테니스 샷 인식에서 최신 기술 수준의 방법들에 비해 정확도 측면에서 어떻게 비교되는가?
  • RQ3광학 흐름 또는 추가 모odal 입력 없이도 원시 RGB 영상만으로 높은 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4LSTM 내의 점수 가중치 메커니즘이 표준 LSTM 아키텍처에 비해 특징 표현 학습을 향상시키는가?

주요 결과

  • 제안된 방법은 테니스 샷 인식을 위한 벤치마크 데이터셋에서 최신 기술 수준의 기준보다 뛰어난 성능을 달성한다.
  • 모델은 광학 흐름이나 추가 입력 모달 없이도 원시 RGB 영상만을 사용하여 강력한 일반화 성능을 보인다.
  • 사전 훈련된 Inception 특징와 가중치가 부여된 LSTM의 통합은 공간-시간 특징 표현 학습을 향상시킨다.
  • LSTM 내의 점수 가중치 메커니즘은 관련된 이전 상태에 집중함으로써 시간적 모델링을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.