Skip to main content
QUICK REVIEW

[論文レビュー] Solving Bongard Problems with a Visual Language and Pragmatic Reasoning

Stefan Depeweg, Constantin A. Rothkopf|arXiv (Cornell University)|Apr 12, 2018
Multimodal Machine Learning Applications参考文献 43被引用数 16
ひとこと要約

本稿では、視覚的特徴抽出と記号的視覚言語、そして実用的推論を組み合わせることで、ボンガード問題を解くための新規なアプローチを提示する。形式的視覚言語におけるベイズ推論を用いて、丁寧に選択された肯定例と否定例から複雑な概念を推論し、例の選択に関する実用的解釈を通じてボンガード自身の解答と一致させることで、これまでで最高の正確性を達成した。

ABSTRACT

More than 50 years ago Bongard introduced 100 visual concept learning problems as a testbed for intelligent vision systems. These problems are now known as Bongard problems. Although they are well known in the cognitive science and AI communities only moderate progress has been made towards building systems that can solve a substantial subset of them. In the system presented here, visual features are extracted through image processing and then translated into a symbolic visual vocabulary. We introduce a formal language that allows representing complex visual concepts based on this vocabulary. Using this language and Bayesian inference, complex visual concepts can be induced from the examples that are provided in each Bongard problem. Contrary to other concept learning problems the examples from which concepts are induced are not random in Bongard problems, instead they are carefully chosen to communicate the concept, hence requiring pragmatic reasoning. Taking pragmatic reasoning into account we find good agreement between the concepts with high posterior probability and the solutions formulated by Bongard himself. While this approach is far from solving all Bongard problems, it solves the biggest fraction yet.

研究の動機と目的

  • 最小限の非ランダムに選択された例から推論を要する視覚的概念学習タスク、すなわちボンガード問題を解くという課題に取り組む。
  • 抽出された画像特徴から形式的視覚言語を構築することで、非記号的視覚処理と記号的推論を橋渡しする。
  • ボンガード問題における例が、ターゲット概念を伝えるために意図的に選ばれていることに着目し、概念誘導に実用的推論を組み込む。
  • 例の選択の背後にあるコミュニケーション的意図をモデル化することで、先行システムを上回る性能を達成する。
  • 構造化された視覚言語におけるベイズ推論が、ボンガード自身が提示した定式化と密接に一致する解を得られることを示す。

提案手法

  • 画像処理技術を用いて、形状、位置、サイズ、空間的関係性などの視覚的特徴を抽出する。
  • 論理的および空間的関係を表現する形式的言語を用いて、これらの特徴を記号的視覚語彙に翻訳する。
  • 与えられた肯定例と否定例から最も可能性の高い概念を誘導するため、ベイズ推論に基づく確率的モデルを定義する。
  • 例がランダムではなく、ターゲット概念を最も効果的に伝えるために選ばれているという仮定をモデル化することで、実用的推論を組み込む。
  • 可能な概念の空間を探索し、事後確率を推定するためにマルコフ連鎖モンテカルロ(MCMC)サンプリングを用いる。
  • 候補となる概念の評価は、事後確率をボンガードの元の解答と比較し、コミュニケーション的意図を調整することで行う。

実験結果

リサーチクエスチョン

  • RQ1形式的視覚言語とベイズ推論を組み合わせることで、ボンガード問題における複雑な視覚的概念を効果的にモデル化できるか?
  • RQ2例の意図的な選択を考慮する実用的推論を組み込むことで、ボンガード問題における概念誘導がどの程度改善されるか?
  • RQ3このタスクにおいて、記号的視覚推論は純粋に非記号的ディープラーニング手法を上回る可能性をどの程度持つか?
  • RQ4構造化された表現と論理的関係は、最小限のデータで視覚的概念学習問題を解く際に果たす役割は何か?
  • RQ5システムが推論した概念は、ボンガード自身が提示した元の解答とどの程度一致するか?

主な発見

  • 本システムは、形式的視覚言語と実用的推論を活用することで、これまでで最高のボンガード問題の解決割合を達成した。
  • 最も高い事後確率を示した概念は、ボンガード自身の解答と密接に一致しており、人間が構築した概念と強い整合性があることを示している。
  • ボンガード問題 #71 において、システムは「左:2番目の順序の図形が内側にある」というルールを最も確率の高いものとして特定し、事後確率は 0.20 であった。
  • ボンガード問題 #79 において、システムは「濃い色の円が三角形よりも輪郭の円に近い」という重要な特徴を正しく特定し、事後確率は 0.12 であった。
  • 実用的推論の組み込みにより、非実用的ベースラインと比較してボンガードの元の解答との整合性が著しく向上した。
  • 象徴的合成を用いて、ネストされた包含関係や相対的距離といった複雑な空間的・関係的特徴を効果的に処理するという点で、本手法は頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。