Skip to main content
QUICK REVIEW

[論文レビュー] Answering Image Riddles using Vision and Reasoning through Probabilistic Soft Logic

Somak Aditya, Yezhou Yang|arXiv (Cornell University)|Nov 17, 2016
Advanced Image and Video Retrieval Techniques参考文献 21被引用数 3
ひとこと要約

本稿では、視覚的理解と一般的常識的推論を要する画像のなぞひらめき(riddle)を解く、新しいタスクを紹介する。確率的ソフト論理(PSL)フレームワークを用い、深層学習によるオブジェクト検出とConceptNetに基づく知識推論を組み合わせた手法を提案。複数の画像に共通する抽象的で共有される概念を推論し、人間によるアノテーションが確認された3,000個のなぞひらめきで構成される新規データセットで優れた性能を達成した。

ABSTRACT

In this work, we explore a genre of puzzles ("image riddles") which involves a set of images and a question. Answering these puzzles require both capabilities involving visual detection (including object, activity recognition) and, knowledge-based or commonsense reasoning. We compile a dataset of over 3k riddles where each riddle consists of 4 images and a groundtruth answer. The annotations are validated using crowd-sourced evaluation. We also define an automatic evaluation metric to track future progress. Our task bears similarity with the commonly known IQ tasks such as analogy solving, sequence filling that are often used to test intelligence. We develop a Probabilistic Reasoning-based approach that utilizes probabilistic commonsense knowledge to answer these riddles with a reasonable accuracy. We demonstrate the results of our approach using both automatic and human evaluations. Our approach achieves some promising results for these riddles and provides a strong baseline for future attempts. We make the entire dataset and related materials publicly available to the community in ImageRiddle Website (http://bit.ly/22f9Ala).

研究の動機と目的

  • 視覚的認識と高レベルの推論を同時にテストする、画像のなぞひらめきを解く新しいベンチマークタスクを導入すること。
  • 4枚の画像と1つの単語による答えを有する、3,000個の画像のなぞひらめきのスケールの大きなデータセットを収集・検証し、クラウドソーシングを用いて意味的整合性と適切な難易度を保証すること。
  • 視覚的検出結果に基づき、確率的共通認識知識を用いて抽象的で共有される概念を推論する推論システムを開発すること。
  • 視覚モデルと構造化された知識推論を組み合わせることで、今後の視覚的推論分野の研究の強力なベースラインを確立すること。
  • この新タスクにおける進展を追跡できる自動評価指標と人間による評価プロトコルを提供すること。

提案手法

  • 各なぞひらめきの画像に対して、最先端の画像分類モデル(例:Clarifai、ResNet)を用い、上位5つのクラスラベル予測を抽出する。
  • ConceptNet 5(語句や語の間の関係をエンコードする知識グラフ)を用いて、検出されたラベルをより広範な意味的空間にマッピングする。
  • 確率的ソフト論理(PSL)を用い、検出されたラベルとConceptNetの知識の両方を対象として構造的推論を実行し、すべての画像に共通する最も確率の高い共有概念を推論する。
  • マルチステージパイプラインを実装する:(1) 視覚的検出、(2) ConceptNetによる概念拡張、(3) PSLを用いた確率的推論により候補となる答えをランク付けする。
  • 予測の過信を軽減し、回答品質を向上させるために、GUR(グローバルアンバイアスドランクイング)モジュールを用いてバイアス補正を実施する。
  • 検定用に500個のなぞひらめきを事前に確保したデータセット上でランダムサーチを用い、ハイパーパrameter(例:類似度の閾値、信頼度の閾値)を最適化する。

実験結果

リサーチクエスチョン

  • RQ1視覚的検出と一般的常識的推論を統合したシステムは、抽象的で概念的なつながりを要する画像のなぞひらめきを効果的に解くことができるか?
  • RQ2ConceptNetを介した構造化された知識の統合は、視覚のみのベースラインと比較して、回答の正確性をどの程度向上させるか?
  • RQ3PSLを用いた確率的推論は、多様な画像にわたる非自明な共有概念を推論するモデルの能力をどの程度高めるか?
  • RQ4人間の評価者は、視覚のみのモデルと比較して、システムが生成する回答の正しさと知的さをどの程度高く評価するか?
  • RQ5一貫したフレームワークは、一意で重複のない答えと多様な視覚的手がかりを持つなぞひらめきに一般化できるか?

主な発見

  • 提案手法のGUR+Allバージョンは、テストセットにおいて単語埋め込みベースの正確性が最も高く、視覚のみのベースラインを上回った。
  • アマゾン・メカニカル・トゥーカーを用いた人間評価では、GUR+Allシステムは知的さ評価で2.2/4を獲得し、Clarifai(2.0/4)やResNet(1.8/4)を顕著に上回った。
  • システムは正答性と説明可能性の両面で向上を示し、人間評価において正答性と知的さの最高スコアボックスに属する回答の割合が高くなった。
  • パイプラインにおける推論段階(RR)での正確性の急上昇は、PSLに基づく推論が性能向上の主因であることを示している。
  • 3,000個のなぞひらめきデータセットはクラウドソーシングにより検証され、意味的整合性と適切な難易度レベルが確認された。
  • 提案手法は良好に一般化しており、わずかな検出ラベルから多数の語彙(ConceptNetの約20万語のエントリ)に基づき、抽象的で非自明な関係を発見できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。