Skip to main content
QUICK REVIEW

[論文レビュー] A Restricted Visual Turing Test for Deep Scene and Event Understanding

H. Jerry Qi, Tianfu Wu|arXiv (Cornell University)|Dec 6, 2015
Multimodal Machine Learning Applications参考文献 35被引用数 13
ひとこと要約

本論文は、長期間にわたり複数のカメラで記録された動画におけるシーンおよびイベントの深層的理解を目的として、空間的・時間的・因果的推論を要するストーリー・ラインに基づくクエリを用いた制限付き視覚的タービングテスト(VTT)を提案する。システムは視覚モジュール、知識ベース、クエリエンジンを統合し、動画を解析して自然言語または2値形式のクエリに応答する。3,426件のクエリ(合計93.5時間分の動画)を含むベンチマークで、定義に関するクエリを除くクエリに対して81%の精度を達成した。

ABSTRACT

This paper presents a restricted visual Turing test (VTT) for story-line based deep understanding in long-term and multi-camera captured videos. Given a set of videos of a scene (such as a multi-room office, a garden, and a parking lot.) and a sequence of story-line based queries, the task is to provide answers either simply in binary form "true/false" (to a polar query) or in an accurate natural language description (to a non-polar query). Queries, polar or non-polar, consist of view-based queries which can be answered from a particular camera view and scene-centered queries which involves joint inference across different cameras. The story lines are collected to cover spatial, temporal and causal understanding of input videos. The data and queries distinguish our VTT from recently proposed visual question answering in images and video captioning. A vision system is proposed to perform joint video and query parsing which integrates different vision modules, a knowledge base and a query engine. The system provides unified interfaces for different modules so that individual modules can be reconfigured to test a new method. We provide a benchmark dataset and a toolkit for ontology guided story-line query generation which consists of about 93.5 hours videos captured in four different locations and 3,426 queries split into 127 story lines. We also provide a baseline implementation and result analyses.

研究の動機と目的

  • 長期間にわたり複数のカメラで記録された動画における空間的・時間的・因果的理解の統合的評価フレームワークの不足に対処すること。
  • 画像ベースのVQAや動画キャプションをはるかに超える、オントロジーに従うストーリー・ラインクエリを用いた制限付きVTTの開発。
  • 空間的・時間的・因果的関係をカバーする高品質で構造化されたクエリを生成するためのベンチマークデータセットおよびツールキットの作成。
  • 個々のモジュールを簡単に交換可能なプラグアンドプレイ方式を採用したモジュラーなビジョンシステムの設計。
  • 回答の明確な中間的推論トレースを要請することで、ビジョンシステムに対する信頼性を向上させること。

提案手法

  • システムは、動画解析、物体検出、トラッキング、再識別、シーン中心の3次元表現を統合した統合アーキテクチャを用い、複数カメラの動画理解を実現する。
  • 知識ベースは、シーン中心の表現(3次元レイアウト、物体の役割、空間的関係など)を格納し、複数のカメラにまたがる統合推論を可能にする。
  • クエリエンジンは、述語と関係を解析することでストーリー・ラインクエリを処理し、ビュー中心のクエリとシーン中心のクエリを区別する。
  • クエリ生成には特定のオントロジーを用い、品質と一貫性を確保し、クラウドソーシングによるオープンエンドの質問がもたらすノイズを回避する。
  • システムは2値(真/偽)および自然言語による回答をサポートし、後続のクエリにおける共通の参照を確立するために、物体定義クエリを用いる。
  • ツールキットは、制御された複雑さを持つストーリーのスケーラブルな生成を可能とし、個々のモジュールの独立した評価を支援する。

実験結果

リサーチクエスチョン

  • RQ1ビジョンシステムは、長期間にわたり複数のカメラで記録された動画におけるシーンおよびイベントについて、空間的・時間的・因果的理解を統合的に達成できるか?
  • RQ2オントロジーに従うストーリー・ラインクエリを用いた制限付きVTTは、従来の正答率指標を超えて、深層的シーン理解の評価にどの程度有効であるか?
  • RQ3プラグ可能なコンponentsを備えたモジュラーなビジョンシステムは、空間的および因果的推論を含む複数の述語を含む複雑なクエリをどの程度処理できるか?
  • RQ4基本的な検出や数え上げタスクと比較して、人間-物体の相互作用やシーンレベルの関係を含む推論タスクにおける性能ギャップはどの程度か?
  • RQ5ビジョンシステムは、回答に対する信頼性を高めるために、解釈可能な推論トレースを提供できるか?

主な発見

  • プロトタイプシステムは、定義に関するクエリを除くクエリで81%の精度を達成した。243件中197件の物体定義クエリが正しく検出された。
  • 1クエリあたりの述語数が増えるにつれて精度が低下し、3つを超える述語を含むクエリでは、誤差の伝搬により顕著に低下した。
  • 物体検出、部品関係、行動認識といった基本的なビジョンタスクでは良好に動作したが、空間的推論および人間-物体の相互作用の推論では困難を示した。
  • 空間的推論および人間と物体の相互作用を含むクエリが最も困難であり、この分野における未解決の研究課題を示している。
  • 物体定義クエリは、相互理解を確立するためのものであり、精度計算には含めない。これは、単に「真」と答えるだけのトリビアルな応答が、実際の検出性能を反映しないからである。
  • 10台のワークステーションから構成されるクラスタを用いて、2週間で1,160件のクエリを処理し、大規模評価におけるスケーラビリティを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。