Skip to main content
QUICK REVIEW

[論文レビュー] HySTER: A Hybrid Spatio-Temporal Event Reasoner

Théophile Sautory, Nuri Cingillioglu|arXiv (Cornell University)|Jan 17, 2021
Semantic Web and Ontologies参考文献 28被引用数 4
ひとこと要約

HySTER は、視覚的認識のためのディープラーニングと、時間的・因果的・物理的イベントに関する記号的推論のための答え集合プログラミング(ASP)を組み合わせた神経記号的 VideoQA モデルである。領域に依存しないルールを用いたイベント検出および因果的推論により、CLEVRER データセットで最先端の精度を達成し、説明可能で一般化可能な動画理解を実現する。

ABSTRACT

The task of Video Question Answering (VideoQA) consists in answering natural language questions about a video and serves as a proxy to evaluate the performance of a model in scene sequence understanding. Most methods designed for VideoQA up-to-date are end-to-end deep learning architectures which struggle at complex temporal and causal reasoning and provide limited transparency in reasoning steps. We present the HySTER: a Hybrid Spatio-Temporal Event Reasoner to reason over physical events in videos. Our model leverages the strength of deep learning methods to extract information from video frames with the reasoning capabilities and explainability of symbolic artificial intelligence in an answer set programming framework. We define a method based on general temporal, causal and physics rules which can be transferred across tasks. We apply our model to the CLEVRER dataset and demonstrate state-of-the-art results in question answering accuracy. This work sets the foundations for the incorporation of inductive logic programming in the field of VideoQA.

研究の動機と目的

  • エンドツーエンドのディープラーニングモデルが、透明性に欠け、複雑な時間的および因果的推論に苦労するという限界を是正すること。
  • 特に答え集合プログラミング(ASP)を用いた記号的 AI を VideoQA に統合し、動画内の物理的イベントについて、構成的で説明可能な推論を可能にすること。
  • 時間的・因果的・物理的イベント推論のため、ニューラル的認識と記号的ルールを組み合わせた一般化可能なフレームワークを構築すること。
  • 神経記号的統合が、CLEVRER のような推論中心の VideoQA ベンチマークで性能向上をもたらすことを実証すること。
  • データからルール学習が可能なインダクティブ論理プログラミング(ILP)を VideoQA に組み込む基盤を築くこと。

提案手法

  • モデルは、ビデオフレームからオブジェクト検出と特徴量を抽出するための Perception モジュールとして Mask R-CNN を使用し、それらを記号的表現にマッピングする。
  • 各時刻でオブジェクトの識別子、位置、速度、物理的性質を符号化する事実を用いて、ASP における記号的シーン表現を構築する。
  • 時間的および因果的関係をモデル化するために、イベント計算フレームワークを採用し、$happens(E,T)$、$holdsAt(F,T)$、$initiates(E,F)$、$terminates(E,F)$ などの述語を用いる。
  • 物理的、因果的、時間論理に関する領域に依存しないルールを ASP にエンコードし、衝突、速度変化、オブジェクト相互作用などのイベントを推論する。
  • 幾何的距離と速度変化のしきい値を用いて、衝突などの物理的イベントを検出するルールを設計し、訓練データ上で最適化する。
  • オブジェクトレベルの記号的事実と論理的ルールを統合した推論パイプラインにより、答え集合上のクエリ評価によって自然言語の質問に回答する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングと記号的推論を組み合わせた神経記号的アプローチは、複雑な時間的および因果的推論を要する VideoQA タスクにおいて、エンドツーエンドのディープラーニングモデルを上回ることができるか?
  • RQ2答え集合プログラミング(ASP)は、一般化された時間的および因果的ルールを用いて、動画内の物理的イベント(例:衝突)を効果的にモデル化・推論できるか?
  • RQ3エンジニアリングされた記号的ルールによるイベント検出は、CLEVRER のような推論中心の VideoQA ベンチマークで、どれほど精度向上に寄与するか?
  • RQ4ASP を用いた記号的推論は、純粋なニューラルネットワークが困難とする、否定や数え上げを含む構成的質問を処理できるか?
  • RQ5インダクティブ論理プログラミング(ILP)による自動ルール学習をサポートするよう、このフレームワークを一般化できるか?

主な発見

  • HySTER は CLEVRER データセットで最先端の性能を達成し、既存のモデルを上回る質問・回答の精度を実現した。
  • Mask R-CNN を用いた Perception モジュールは、1,000 本の訓練動画においてオブジェクト検出および分類で F1 スコア 0.991 を達成し、高精度な記号的入力を保証した。
  • 速度変化ルールは、衝突する対とそうでない対を効果的に区別でき、衝突前後における分布の明確な分離が確認された。
  • 図 2 に示すように、衝突検出のためのユークリッド距離のしきい値は、非衝突ペアを効果的に除外しながら、ほとんどすべての実際の衝突を保持した。
  • 記号的推論モジュールにより、否定や数え上げを含む構成的質問の正確な処理が可能となり、純粋なニューラルモデルが困難とする課題を克服した。
  • 複数の時間フレームにわたるイベントを検出する能力が強く、衝突前・中・後の各段階で一貫した速度変化パターンを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。