[論文レビュー] 3D-POP -- An automated annotation approach to facilitate markerless 2D-3D tracking of freely moving birds with marker-based motion capture
本論文では、マーカーに基づくモーショングラフ技術を用いた半自動的手法である3D-POPを紹介する。この手法により、自由に移動する鳥の2次元および3次元キーポイントアノテーションを高品質に生成できる。体のマーカーから相対的に形態的キーポイント(例:くちばし、目)を推定することで、2次元/3次元ポーズ、個体識別、軌道の真値を備えた30万フレーム(400万インスタンス)の大規模データセットが作成され、鳥における耐障害性の高いマーカーレス2次元/3次元トラッキングおよびポーズ推定を可能にする。
Recent advances in machine learning and computer vision are revolutionizing the field of animal behavior by enabling researchers to track the poses and locations of freely moving animals without any marker attachment. However, large datasets of annotated images of animals for markerless pose tracking, especially high-resolution images taken from multiple angles with accurate 3D annotations, are still scant. Here, we propose a method that uses a motion capture (mo-cap) system to obtain a large amount of annotated data on animal movement and posture (2D and 3D) in a semi-automatic manner. Our method is novel in that it extracts the 3D positions of morphological keypoints (e.g eyes, beak, tail) in reference to the positions of markers attached to the animals. Using this method, we obtained, and offer here, a new dataset - 3D-POP with approximately 300k annotated frames (4 million instances) in the form of videos having groups of one to ten freely moving birds from 4 different camera views in a 3.6m x 4.2m area. 3D-POP is the first dataset of flocking birds with accurate keypoint annotations in 2D and 3D along with bounding box and individual identities and will facilitate the development of solutions for problems of 2D to 3D markerless pose, trajectory tracking, and identification in birds.
研究の動機と目的
- 複雑な社会的状況下における自由に移動する鳥のための、大規模で高解像度、マルチビューの2次元および3次元アノテーションデータセットが不足しているという課題に対処すること。
- 手動による形態的特徴のラベリングを必要としない、スケーラブルで半自動的な2次元および3次元キーポイントアノテーションの生成手法を開発すること。
- マーカーレス2次元/3次元ポーズ推定、軌道トラッキング、個体識別を目的としたディープラーニングモデルの学習を可能にすること。
- アクセスが困難な形態的キーポイントを、アクセス可能な体部に取り付けた反射マーカーを代理として用いることで、そのアノテーションの課題を克服すること。
- 実際の自然状態下で多頭のトラッキングと3次元ポーズ推定を支援する、公開可能なベンチマークデータセット(3D-POP)を構築すること。
提案手法
- 本手法は、ハoming・ピグレットのアクセス可能な体部(例:頭部、バックパック)に取り付けた反射マーカーを追跡するViconモーショングラフシステムを用いる。
- 追跡されたマーカーに対する剛体変換として、形態的キーポイント(例:目、くちばし、尾)の3次元位置を推定する。
- 鳥の頭部および体が剛体として振る舞うという仮定を活用することで、マーカーのデータから正確な3次元キーポイント予測が可能になる。
- 4台の同期されたRGBカメラからの動画データを用いて、3次元キーポイントの2次元投影を生成し、マルチビューのデータセットを構築する。
- ノイズの多いアノテーションを特定・フィルタリングするための外れ値検出アルゴリズムを適用し、データ品質を向上させる。
- その結果得られたデータセット、3D-POPには、30万フレーム分のアノテーションが含まれており、2次元/3次元キーポイント座標、バウンディングボックス、最大10頭の個体識別情報が付与されている。
実験結果
リサーチクエスチョン
- RQ1モーショングラフシステムを用いて、形態的キーポイントの手動ラベリングを一切行わずに、半自動的に正確な2次元および3次元キーポイントアノテーションを生成できるか?
- RQ2自由に移動する鳥において、マーカーに基づく剛体仮定を用いた形態的キーポイントの推定はどの程度の精度を示すか?
- RQ33D-POPで学習されたディープラーニングモデルは、実世界の鳥のトラッキングシナリオにおけるマーカーレスポーズ推定に一般化可能か?
- RQ4このデータセットは、複雑で自然主義的な群れにおいて、多頭の2次元/3次元トラッキングおよび個体識別をどの程度サポートできるか?
- RQ5マーカーに基づく代理アノテーションが、マーカーレスポーズ推定モデルの性能に及ぼす影響は何か?
主な発見
- 自動生成された3D-POPキーポイントを手動アノテーションと比較した結果、平均PCK05は66%、PCK10は94%を達成しており、真値と強い一致を示している。
- 剛体仮定に反する翼の動きが発生したフレームは全体の2.8%にとどまり、この手法がデータセットの大部分で堅牢であることを裏付けている。
- 3D-POPで事前学習されたYOLOv5sおよびDeepLabCutモデルは、マーカーレス画像においてもキーポイント位置を正確に予測でき、マーカーレス推論への一般化を示した。
- 3D-POPデータセットには、4台のカメラビューをカバーする約30万フレーム(400万インスタンス)のアノテーションが含まれており、1回の試行で最大10頭の個体が含まれる。
- 本データセットは、個体識別、ポーズ、軌道の真値を備えたマルチビュー・マルチインディビデュアル2次元/3次元トラッキングをサポートしており、マーカーレストラッキングシステムのベンチマークが可能になる。
- 本手法により、人的労力の最小限の状態で大規模なデータキュレーションが可能となり、動物行動の3次元アノテーションに要する時間と労力を顕著に削減できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。