Skip to main content
QUICK REVIEW

[論文レビュー] ECAT: Event Capture Annotation Tool

Tuan Do, Nikhil Krishnaswamy|arXiv (Cornell University)|Oct 5, 2016
Scientific Computing and Data Management参考文献 8被引用数 8
ひとこと要約

ECAT は、Microsoft Kinect の動画から 3D 物体およびボディリグの動きを捉えるオープンソースで使いやすいアノテーションツールであり、意味的マークアップを用いた詳細なイベント・参加者関係のアノテーションを可能にする。出力は VoxML にマッピングされ、運動と空間意味論を研究するためのマルチモーダルで意味的に豊かなイベントデータコーパスを構築する。

ABSTRACT

This paper introduces the Event Capture Annotation Tool (ECAT), a user-friendly, open-source interface tool for annotating events and their participants in video, capable of extracting the 3D positions and orientations of objects in video captured by Microsoft's Kinect(R) hardware. The modeling language VoxML (Pustejovsky and Krishnaswamy, 2016) underlies ECAT's object, program, and attribute representations, although ECAT uses its own spec for explicit labeling of motion instances. The demonstration will show the tool's workflow and the options available for capturing event-participant relations and browsing visual data. Mapping ECAT's output to VoxML will also be addressed.

研究の動機と目的

  • ビデオにおける物体および人間のボディの 3D 動きを捉えるツールの開発を目的とする。
  • Kinect の深度センシングとスケルトントラッキングを活用して、2D ビデオトラッキングと 3D 動きモデリングの橋渡しをすること。
  • 自然言語およびビジョン研究における応用を想定した、参加者関係を含む意味的関係を持つアノテート済みイベントのコーパス作成を支援すること。
  • アノテート済みイベントを VoxML にマッピングし、手続き的 3D シーン再構築およびシミュレーションを可能にすること。
  • 語句接続子を用いた物語的構造やサブイベント・ナラティブシーケンスを含む、複雑なイベント構造をサポートすること。

提案手法

  • ECAT は Kinect Sensor v2 を使用して、高解像度の RGB、深度、ボディトラッキングデータを収集し、大容量ファイルを管理するためのカスタム圧縮を実施する。
  • Kinect SDK を用いた人間のボディリグの自動検出と、RGB ストリーム上でのバウンディングポリゴンによる他の物体の手動アノテーションをサポートする。
  • 深度フィールドデータと反復最密対応法(ICP)アルゴリズムを用いて、時間経過に伴う物体の位置および姿勢の推定を半自動的に実行する。
  • ユーザーは時間スクラッチ可能なインターフェースを用いて、イベントを自然言語で記述し、参加者を定義し、空間関係(例:On, In, Attach To)を指定する。
  • スーパーエンティティ/サブエントティのリンクを用いたイベントのサブ構造化を可能とし、意味的モデリングのための VoxML イベントタイプへのリンクを許容する。
  • ECAT の出力は VoxML にマッピングされ、パラメトリックな運動および空間関係を伴う、完全な 3D シミュレーションによるアノテート済みイベントの再構築を可能にする。

実験結果

リサーチクエスチョン

  • RQ1Kinect からの 3D 動作データを、意味的イベントモデリングに効果的に捉え、アノテートする方法は何か?
  • RQ2ビデオにおけるイベント・参加者関係の正確でスケーラブルかつ意味的に豊かなラベリングを可能にするアノテーションインターフェースはどのようなものか?
  • RQ3アノテート済みのビデオデータを、シミュレーションに適した形式的意味表現言語(例:VoxML)に体系的にマッピングする方法は何か?
  • RQ4マルチモーダルコーパスにおけるイベント意味論のモデリングに必要な、動きおよび空間関係の詳細度はどの程度か?
  • RQ5重複または並列なイベントを含む物語的ビデオシーケンスを、意味的マークアップを用いてどのようにアノテートし、リンクするか?

主な発見

  • ECAT は、Kinect 動画から物体および人間のボディリグの 3D 位置と姿勢を効果的に捉え、高精度な運動アノテーションを可能にした。
  • 深度データと ICP ベースの手法を用いた、手動および半自動の物体トラッキングをサポートし、3D 空間におけるトラッキング精度を向上させた。
  • ECAT は、非連続セグメントや階層的サブイベントを含む、複雑なイベント構造のアノテーションを可能にした。
  • 空間関係(例:On, In, Attach To)を明示的に含む意味的豊かなイベントアノテーションが可能であり、VoxML イベントタイプにリンクされており、手続き的シミュレーションが可能である。
  • ECAT から VoxML へのマッピングにより、アノテート済みイベントを 3D シミュレーション環境で完全に再構築でき、動画と合成シーンをリンクしたデータセットの作成が可能になった。
  • フレームネットやイベントオントロジーなどの語彙的リソースへの将来的な統合をサポートする拡張性を有し、語句接続子を用いた長時間のナラティブ動画アノテーションの拡張も進行中である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。