Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Grained Action Detection with RGB and Pose Information using Two Stream Convolutional Networks

Leonard Hacker, Finn Bartels|arXiv (Cornell University)|2023. 02. 06.
Stroke Rehabilitation and RecoveryMedicine인용 수 3
한 줄 요약

이 논문은 RGB 비디오 프레임과 MMPose를 통해 추출한 인간 자세 정보를 융합하는 이중 스트림 3D CNN 프레임워크를 제안한다. 원시 RGB와 RGB 위에 오버랩된 자세 정보(PRGB) 스트림을 후기 특징 융합을 통해 조합함으로써, 분류 정확도가 87.3%에 도달하여 기준 모델을 약간 향상시켰지만, 탐지 성능은 여전히 제한적이며, IoU는 0.349, mAP는 0.110에 머물렀다.

ABSTRACT

As participants of the MediaEval 2022 Sport Task, we propose a two-stream network approach for the classification and detection of table tennis strokes. Each stream is a succession of 3D Convolutional Neural Network (CNN) blocks using attention mechanisms. Each stream processes different 4D inputs. Our method utilizes raw RGB data and pose information computed from MMPose toolbox. The pose information is treated as an image by applying the pose either on a black background or on the original RGB frame it has been computed from. Best performance is obtained by feeding raw RGB data to one stream, Pose + RGB (PRGB) information to the other stream and applying late fusion on the features. The approaches were evaluated on the provided TTStroke-21 data sets. We can report an improvement in stroke classification, reaching 87.3% of accuracy, while the detection does not outperform the baseline but still reaches an IoU of 0.349 and mAP of 0.110.

연구 동기 및 목표

  • 시각적 정보와 인간 자세 정보를 융합하여 스포츠 영상에서의 미세한 동작 탐지 성능을 향상시키는 것.
  • 기존의 RGB 기반 모델을 초월해 자세 표현이 행동 인식 및 탐지 성능을 향상시킬 수 있는지 조사하는 것.
  • 이중 스트림 3D-CNN 아키텍처에서 다양한 자세 융합 전략(예: PRGB 대 자세 전용)의 효과를 평가하는 것.
  • 테이블 테니스 스트로크와 같이 클래스 간 변동성이 낮은 동작에서 자세 데이터가 보완 기능을 할 수 있는지 판단하는 것.
  • TTStroke-21 데이터셋에서 분류 및 탐지 작업 모두에 대해 MediaEval 2022 기준 모델과의 성능 비교를 수행하는 것.

제안 방법

  • 원시 RGB 비디오 클립을 처리하는 스트림과 자세 향상 프레임을 처리하는 스트림을 가진 이중 스트림 3D-CNN 아키텍처를 사용한다.
  • 자세 정보는 MMPose 도구상자를 사용하여 각 프레임의 감지된 인물에 대해 상향식 키포인트 추정을 적용하여 추출한다.
  • 두 가지 자세 기반 입력을 평가한다: 검은 배경 위의 자세 (Pose)와 원본 RGB 프레임 위에 오버랩된 자세 (PRGB).
  • 최종 분류 레이어 이전에 후기 특징 융합을 적용하며, 합산 융합이 가장 우수한 성능을 보였다.
  • 스페이시오타임프레스처를 포착하기 위해 주의 메커니즘을 갖춘 3D 컨volution 신경망(3D-CNN) 블록을 사용한다.
  • 학습은 Tesla V100 GPU를 사용하여 2000 에포크 동안 수행되었으며, 학습률은 0.0001, 모멘터는 0.5로 설정되었다.
(a) RGB
(a) RGB

실험 결과

연구 질문

  • RQ1RGB와 자세 정보를 융합함으로써 단일 스트림 RGB 모델 대비 테이블 테니스 영상에서의 미세한 동작 분류 성능을 향상시킬 수 있는가?
  • RQ2자세 정보가 변동성이 낮은 동작(예: 테이블 테니스 스트로크)의 탐지 성능 향상에 기여하는가?
  • RQ3이중 스트림 3D-CNN에서 탐지 작업에 있어 조기, 후기, 중간 융합 전략 중 어느 것이 가장 높은 성능을 낳는가?
  • RQ4자세 추정의 정확도가 유사한 테이블 테니스 스트로크를 구분하는 데 모델의 능력에 어떤 영향을 미치는가?
  • RQ5자세 데이터가 라켓, 공 등의 물체 수준의 단서가 부족한 탐지 작업에서 보완 기능을 할 수 있는가?

주요 결과

  • 이중 스트림 모델은 스트로크 분류에서 테스트 정확도 87.3%를 달성하여 기준 모델 대비 0.9% 향상되었다.
  • 가장 우수한 탐지 성능은 RGB와 PRGB 이중 스트림 구성에서 달성되었으며, IoU는 0.349, mAP는 0.110이었다.
  • 자세 전용 스트림은 탐지 성능에서 뚜렷한 열등성을 보였으며, mAP는 0.046로 하락했다. 이는 자세 데이터만으로는 분류에 유용한 특징이 부족함을 시사한다.
  • 후기 융합에서 특징 합산 방식이 가중 평균 및 연결 융합보다 우수한 성능을 보였으며, 이는 최종 레이어에서 융합하는 것이 최적임을 나타낸다.
  • 분류 성능 향상에도 불구하고 탐지 성능은 기준 모델을 초월하지 못했으며, 이는 자세 데이터에 공과 라켓 등의 단서가 누락되어 있기 때문일 것이다.
  • 모델는 강력한 일반화 능력을 보였으며, RGB와 PRGB 스트림의 검증 정확도가 0.848에 도달하여 TTStroke-21 데이터셋에서 안정적인 학습을 이룬 것으로 나타났다.
(b) Pose
(b) Pose

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.