Skip to main content
QUICK REVIEW

[論文レビュー] Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning

Weili Nie, Zhiding Yu|arXiv (Cornell University)|Oct 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 48被引用数 20
ひとこと要約

本稿では、人間のレベルの概念学習をモデル化するため、プログラム制御されたLOGO言語を用いて生成された12,000件の人が理解可能な視覚的推論問題であるBongard-LOGOを紹介する。実験の結果、最先端の深層学習モデルが人間と比べて著しく性能を発揮しないことが明らかとなり、無限の語彙を持つ文脈依存的で類推的かつ少数の例に依存する視覚的推論をモデル化する点で、顕著なギャップが存在することが示された。

ABSTRACT

Humans have an inherent ability to learn novel concepts from only a few samples and generalize these concepts to different situations. Even though today's machine learning models excel with a plethora of training data on standard recognition tasks, a considerable gap exists between machine-level pattern recognition and human-level concept learning. To narrow this gap, the Bongard problems (BPs) were introduced as an inspirational challenge for visual cognition in intelligent systems. Despite new advances in representation learning and learning to learn, BPs remain a daunting challenge for modern AI. Inspired by the original one hundred BPs, we propose a new benchmark Bongard-LOGO for human-level concept learning and reasoning. We develop a program-guided generation technique to produce a large set of human-interpretable visual cognition problems in action-oriented LOGO language. Our benchmark captures three core properties of human cognition: 1) context-dependent perception, in which the same object may have disparate interpretations given different contexts; 2) analogy-making perception, in which some meaningful concepts are traded off for other meaningful concepts; and 3) perception with a few samples but infinite vocabulary. In experiments, we show that the state-of-the-art deep learning methods perform substantially worse than human subjects, implying that they fail to capture core human cognition properties. Finally, we discuss research directions towards a general architecture for visual reasoning to tackle this benchmark.

研究の動機と目的

  • 機械のパターン認識と人間レベルの視覚的概念学習の間の持続的なギャップを是正すること、特に少数の例に依存する、文脈依存的で類推的な推論において。
  • 人間の認知の核となる性質、たとえば文脈依存的知覚や無限語彙一般化を捉える、スケーラブルで人間が理解可能なベンチマークを開発すること。
  • 従来の認識タスクを超えて、構成的かつ抽象的な視覚的推論を重視するベンチマークを設計することで、既存の深層学習モデルに挑戦すること。
  • 神経的および記号的推論を統合する新しい計算アーキテクチャの開発を促進すること。
  • 現代のデータ駆動型手法に適した標準化された大規模データセットを提供するが、元のBongard問題が持つ認知的複雑性を保持すること。

提案手法

  • アクション指向のLOGO言語を用いたプログラム制御生成技術を採用し、手順的形状列を有する12,000件の視覚的に解釈可能な問題を合成する。
  • 三つの認知的性質に焦点を当てて問題を設計する:文脈依存的知覚、類推的知覚、無限語彙を用いた少数の例による学習。
  • サイズ、方向、空間的位置を区別要因として除外し、形状のストローク、カテゴリ、属性(例:凸性、対称性、三角形)に基づいて概念を定義する。
  • モデルが少数の例示をもとに、テスト画像を集合A(肯定)またはB(否定)に分類する、少数の例による概念学習問題としてタスクを定式化する。
  • 最先端のメタラーニングおよび抽象的推論アルゴリズムを用いて、モデルの性能を人間被験者と比較する。
  • アブレーションスタディおよび失敗モード分析を実施し、特に一般化能力とインダクティブバイアスの観点から、現在の学習ベースのアプローチの限界を同定する。

実験結果

リサーチクエスチョン

  • RQ1最新の深層学習モデルは、文脈依存的で類推的知覚を要する視覚的推論タスクで人間並みの性能を達成できるか?
  • RQ2現在のメタラーニングおよび抽象的推論モデルは、最小限の監視のもとで、新しい視覚的概念にどの程度一般化できるか?
  • RQ3無限語彙を持つ人間らしい少数の例による視覚的概念学習をモデル化するにあたり、どのようなインダクティブバイアスが不可欠か?
  • RQ4深層学習モデルの失敗モードは、Bongard形式の問題における人間の推論パターンとどのように異なるか?
  • RQ5ハイブリッド型ニューラル記号的アーキテクチャは、このベンチマークにおいて人間の視覚的認知の構成的かつ抽象的な性質をよりよく捉えることができるか?

主な発見

  • 最先端の深層学習モデル、特にメタラーニングおよび抽象的推論ネットワークは、Bongard-LOGOベンチマークにおいて人間被験者と比べて著しく性能を発揮しない。
  • メタラーニング手法が他のアプローチを上回ることから、学び直す能力(「学びを学ぶ」能力)が、少数の例による視覚的推論における一般化に不可欠であることが示された。
  • 異なるメタラーニングバージョンは、タスク固有の強みを示しており、あらゆる概念タイプに普遍的に一般化できる単一のアーキテクチャは存在しないことが示唆された。
  • 人間と機械の間の性能ギャップは、現在のモデルが文脈依存的知覚や類推的推論を正しく捉えていないことを示している。
  • アブレーションスタディの結果、モデルは抽象的属性や関係的概念に対して苦労しており、特に同じ形状が文脈によって解釈が変わる場合に顕著に困難を示した。
  • このベンチマークは、現在のデータ駆動型アプローチの根本的な限界を露呈しており、特に視覚的知覚における構成性と記号的抽象化をモデル化する点で顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。