Skip to main content
QUICK REVIEW

[論文レビュー] Talking about the Moving Image: A Declarative Model for Image Schema Based Embodied Perception Grounding and Language Generation

Jakob Suchan, Mehul Bhatt|arXiv (Cornell University)|Aug 13, 2015
Constraint Satisfaction and Optimization参考文献 35被引用数 3
ひとこと要約

本論文は、画像スキーマを用いて視覚的空間的ダイナミクスを根拠づけ、動画像の自然言語要約を生成する宣言的で制約論理プログラミングに基づくモデルを提示する。空間的言語抽象化、画像スキーマ、およびクエリに強い言語生成器を統合し、実世界のデータにおいて平均77.8msの文生成時間と1つの要約あたり26.2文の生成を達成した。

ABSTRACT

We present a general theory and corresponding declarative model for the embodied grounding and natural language based analytical summarisation of dynamic visuo-spatial imagery. The declarative model ---ecompassing spatio-linguistic abstractions, image schemas, and a spatio-temporal feature based language generator--- is modularly implemented within Constraint Logic Programming (CLP). The implemented model is such that primitives of the theory, e.g., pertaining to space and motion, image schemata, are available as first-class objects with `deep semantics' suited for inference and query. We demonstrate the model with select examples broadly motivated by areas such as film, design, geography, smart environments where analytical natural language based externalisations of the moving image are central from the viewpoint of human interaction, evidence-based qualitative analysis, and sensemaking. Keywords: moving image, visual semantics and embodiment, visuo-spatial cognition and computation, cognitive vision, computational models of narrative, declarative spatial reasoning

研究の動機と目的

  • 動的視覚的空間的認識を画像スキーマに根拠づける一般理論および宣言的モデルを構築すること。
  • 形式的でクエリ可能な表現を用いて、動画像内の空間、運動、時間的ダイナミクスについての深い意味的推論を可能にすること。
  • 完全に宣言的な論理プログラミングフレームワークを通じて、視覚的入力から言語、および逆に言語から視覚的入力への双方向推論を支援すること。
  • 映画、デザイン、地理的情報分析、スマート環境などの分野における分析的言語生成を支援するモジュラーで拡張に強いシステムを提供すること。
  • 画像スキーマと定性的な空間時間的抽象化を、認知的ビジョンと人間-コンピュータインタラクションの基盤的プリミティブとして使用する可能性を実証すること。

提案手法

  • モデルは制約論理プログラミング(CLP)で実装されており、画像スキーマ、空間的関係、運動プリミティブを第一級の意味的豊かな対象として扱う。
  • コンピュータビジョンからの時間的空間的特徴(例:光流、HOG、顔検出)が、定性的で言語的動機付けのある表現に抽象化される。
  • コンtainment(包含)、path(経路)、source-path-goal(出発点-経路-目的地点)などの画像スキーマが、CLPフレームワーク内での宣言的で推論可能な構造として形式化される。
  • 言語生成部は論理ベースの構文木と語彙マッピングを用い、現在形、過去形、未来形の自然言語要約を生成する。
  • システムは双方向クエリをサポートしており、入力データから文への変換、および文からその言語的・意味的分解への逆変換が可能である。
  • パイプライン全体がモジュラーかつ拡張に強い設計となっており、事実・規則・制約の追加・削除が生成プロセスを破壊せずに可能である。

実験結果

リサーチクエスチョン

  • RQ1どのようにして画像スキーマを、視覚的空間的推論のための宣言的で推論可能なフレームワーク内での第一級の意味的豊かな対象として形式化できるか?
  • RQ2画像スキーマと空間時間的抽象化に根拠づいた宣言的モデルは、視覚的入力と自然言語出力の間でどの程度双方向推論を可能にするか?
  • RQ3制約論理プログラミングに基づくシステムは、動的視覚シーンからの効率的でクエリに強い、言語的に正確な言語生成を達成できるか?
  • RQ4本モデルは、映画、デザイン、地理的情報分析などの多様な分野において、分析的に意味のある、文脈的に整合性のある動画像要約をどの程度効果的に生成できるか?
  • RQ5実世界の視覚的データに対して、完全に宣言的で記号的なアプローチを用いて自然言語要約を生成する際の性能オーバーヘッドはどの程度か?

主な発見

  • 単純な時制では平均77.8ms、継続形では84.48ms、複雑な文では1.32msの平均文生成時間を達成した。
  • 1つの要約あたり平均26.2文を生成し、平均文長は17.6語であった。これは高い出力密度と整合性を示している。
  • 言語生成システムは完全に宣言的で拡張に強く、事実や規則の追加・削除に対しても正しさと一貫性を維持していた。
  • システムは双方向クエリを成功裏にサポートしており、視覚的入力から文への変換、および文からその言語的・意味的分解への逆変換が可能であった。
  • 25人の被験者に対して500件のIDSインスタンスを用いた実証的評価により、本モデルの実世界における頑健性とスケーラビリティが確認された。
  • 本モデルは、動的視覚データの定性的で意味の理解を求める分析を必要とする支援技術や認知的システムにおける強力な応用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。