Skip to main content
QUICK REVIEW

[論文レビュー] Fine-Grained Action Detection with RGB and Pose Information using Two Stream Convolutional Networks

Leonard Hacker, Finn Bartels|arXiv (Cornell University)|Feb 6, 2023
Stroke Rehabilitation and RecoveryMedicine被引用数 3
ひとこと要約

本稿では、RGB動画フレームとMMPoseを用いて抽出された人体ポーズ情報を融合する2ストリーム3次元畳み込みニューラルネットワーク(3D-CNN)フレームワークを提案し、細分化されたテニスストローク検出を実現する。Raw RGBとポーズ・オーバー-RGB(PRGB)ストリームを組み合わせ、ラテン特徴抽出を適用することで、分類精度が87.3%に達した。これはベースラインをわずかに上回ったが、検出性能は限定的であり、IoUは0.349、mAPは0.110にとどまった。

ABSTRACT

As participants of the MediaEval 2022 Sport Task, we propose a two-stream network approach for the classification and detection of table tennis strokes. Each stream is a succession of 3D Convolutional Neural Network (CNN) blocks using attention mechanisms. Each stream processes different 4D inputs. Our method utilizes raw RGB data and pose information computed from MMPose toolbox. The pose information is treated as an image by applying the pose either on a black background or on the original RGB frame it has been computed from. Best performance is obtained by feeding raw RGB data to one stream, Pose + RGB (PRGB) information to the other stream and applying late fusion on the features. The approaches were evaluated on the provided TTStroke-21 data sets. We can report an improvement in stroke classification, reaching 87.3% of accuracy, while the detection does not outperform the baseline but still reaches an IoU of 0.349 and mAP of 0.110.

研究の動機と目的

  • スポーツ動画における細分化された行動検出を、視覚的情報と人体ポーズ情報を併用することで向上させること。
  • 従来のRGBベースのモデルに比べ、ポーズ表現が行動認識および検出性能を向上させることを検証すること。
  • 2ストリーム3D-CNNアーキテクチャにおいて、異なるポーズ融合戦略(例:PRGB対ポーズのみ)の有効性を評価すること。
  • ポーズデータが、卓球ストロークのようにクラス間の変動が小さい行動に対して、補完的役割を果たすかどうかを検討すること。
  • TTStroke-21データセットにおいて、MediaEval 2022のベースラインと比較して、分類および検出タスクの両方で性能をベンチマークすること。

提案手法

  • 1つのストリームがRaw RGB動画クリップを処理し、もう1つのストリームがポーズ強化フレームを処理する2ストリーム3D-CNNアーキテクチャを採用する。
  • 人体ポーズ情報はMMPoseツールボックスを用いて抽出され、各フレームで検出された人物に対してトップダウン方式のキーポoint推定が適用される。
  • 2種類のポーズベース入力を評価:黒背景上のポーズ(Pose)と元のRGBフレームに重ねられたポーズ(PRGB)。
  • 最終分類層の直前に、ラテン特徴抽出を適用し、和分類が最も優れた性能を示した。
  • 空間的・時間的特徴を捉えるために、アテンション機構を内蔵した3D畳み込みニューラルネットワーク(3D-CNN)ブロックを採用する。
  • 学習率0.0001、モーメンタム0.5で、2000エポックにわたりTesla V100 GPUを用いて学習を実施する。
(a) RGB
(a) RGB

実験結果

リサーチクエスチョン

  • RQ1RGBとポーズ情報を組み合わせることで、単一ストリームのRGBモデルに比べ、卓球動画における細分化された行動分類性能が向上するか?
  • RQ2ポーズ情報は、変動が小さい行動(例:卓球ストローク)の検出性能を向上させるか?
  • RQ32ストリーム3D-CNNにおける行動検出タスクにおいて、早期融合、ラテン融合、中間融合のうち、どの融合戦略が最も優れた性能を示すか?
  • RQ4ポーズ推定の品質が、類似した卓球ストロークを区別するモデルの能力に与える影響はいかほどか?
  • RQ5検出タスクにおいて、ラケットやボールといったオブジェクトレベルの手がかりが欠落している状況でも、ポーズデータがそれを補完できるか?

主な発見

  • 2ストリームモデルは、ストローク分類において87.3%のテスト精度を達成し、これはベースライン比0.9%の向上を示した。
  • 最高の検出性能は、RGBとPRGBの2ストリーム構成で得られ、IoUは0.349、mAPは0.110であった。
  • ポーズのみのストリームは顕著に性能が低く、mAPは0.046にまで低下した。これは、ポーズデータのみでは識別的特徴が不足していることを示唆している。
  • ラテン融合における特徴の和分類が、重み付きおよび連結融合を上回った。これは、最終層での特徴統合が最適なタイミングであることを示している。
  • 分類性能の向上にもかかわらず、検出性能はベースラインを上回らなかった。これは、ポーズデータにボールやラケットの手がかりが欠落していることが主な要因と考えられる。
  • モデルは優れた一般化性能を示し、RGBとPRGBストリームの検証精度は0.848に達した。これは、TTStroke-21データセット上で堅牢な学習が行われたことを示している。
(b) Pose
(b) Pose

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。