Skip to main content
QUICK REVIEW

[論文レビュー] ZeroC: A Neuro-Symbolic Model for Zero-shot Concept Recognition and Acquisition at Inference Time

Tailin Wu, Megan Tjandrasuwita|arXiv (Cornell University)|Jun 30, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

ZeroCは、視覚的概念と関係性を記号的グラフ構造上のエネルギーに基づくモデル(EBM)としてモデル化することにより、推論時にゼロショット認識および新規視覚的概念の習得を可能にする神経記号的フレームワークである。概念と関係性を、記号的グラフとEBMの1対1対応によって組み合わせることで、再訓練を必要とせずに、ドメインを越えて正確な検出と分類を達成する。

ABSTRACT

Humans have the remarkable ability to recognize and acquire novel visual concepts in a zero-shot manner. Given a high-level, symbolic description of a novel concept in terms of previously learned visual concepts and their relations, humans can recognize novel concepts without seeing any examples. Moreover, they can acquire new concepts by parsing and communicating symbolic structures using learned visual concepts and relations. Endowing these capabilities in machines is pivotal in improving their generalization capability at inference time. In this work, we introduce Zero-shot Concept Recognition and Acquisition (ZeroC), a neuro-symbolic architecture that can recognize and acquire novel concepts in a zero-shot way. ZeroC represents concepts as graphs of constituent concept models (as nodes) and their relations (as edges). To allow inference time composition, we employ energy-based models (EBMs) to model concepts and relations. We design ZeroC architecture so that it allows a one-to-one mapping between a symbolic graph structure of a concept and its corresponding EBM, which for the first time, allows acquiring new concepts, communicating its graph structure, and applying it to classification and detection tasks (even across domains) at inference time. We introduce algorithms for learning and inference with ZeroC. We evaluate ZeroC on a challenging grid-world dataset which is designed to probe zero-shot concept recognition and acquisition, and demonstrate its capability.

研究の動機と目的

  • 学習例が一切ない状況でも、構成概念とそれらの関係性の記号的記述のみを用いて、機械が新規視覚的概念を認識できるようにすること。
  • 記号的グラフ構造を通じて、推論時に新概念を習得・表現し、コミュニケーションできる能力をモデルに与えること。
  • 統一された神経記号的アーキテクチャを用いて、認識(概念の存在を推論すること)と習得(新概念モデルの構築)の両方においてゼロショット一般化を達成すること。
  • 学習済みEBMコンポーネントと記号的関係構造を活用することで、合成概念のドメイン間転送を可能にすること。
  • アーキテクチャの再チューニングなしに、多様なデータセットと概念階層にわたってスケーラブルで汎用的なフレームワークを設計すること。

提案手法

  • 視覚的概念と関係性を、入力として画像、マスク(複数可)、および概念/関係ラベル文字列を有するエネルギーに基づくモデル(EBM)として表現する。
  • 記号的グラフ構造(ノード=概念、エッジ=関係)と対応するEBMコンポーネントの1対1対応を用い、推論時における合成を可能にする。
  • エンドツーエンドの推論に確率的勾配ラングヴィンダイナミクス(SGLD)を適用し、マスク予測と概念検出のためのエネルギー最小化を実現する。
  • (画像、マスク、ラベル)のタプルを含むデータセットでEBMを学習する。ここでラベルは、内在的変動を有する概念や関係(例:「鋭い角度」が異なる角度で現れる場合)を記述する。
  • 画像を構成概念のマスクと関係グラフに分解し、既存のEBMコンポーネントを用いて階層的概念の新しいEBMを合成することで、概念の習得を可能にする。
  • 同じEBMフレームワークを用いて分類(ラベル予測)と検出(マスク予測)の両方のタスクを実行し、推論はSGLDサンプリングによって実施する。

実験結果

リサーチクエスチョン

  • RQ1学習済みの新規概念の例が一切ない状況でも、構成概念とそれらの関係性の記号的記述のみを用いて、モデルが推論時に新規視覚的概念を認識できるか?
  • RQ2画像を解析して検出された基本概念から記号的グラフ構造を構築することで、モデルが推論時に新しい階層的概念を習得・表現できるか?
  • RQ3同じEBMベースのアーキテクチャが、アーキテクチャの再チューニングなしに、異なるデータセットや概念階層に一般化できるか?
  • RQ4グリッドワールドから3Dの合成環境に至るまで、ドメインを越えて合成概念の検出と分類がどの程度正確にできるか?
  • RQ5画像サイズやオブジェクト数の増加に伴って、推論パイプラインの計算効率はどの程度か?

主な発見

  • ZeroCは、学習済みEBMコンポーネントと記号的グラフ構造のみを用いて、グリッドワールド環境で階層的で新規の概念(例:「F」、「長方形」)の正確なゼロショット検出と分類を達成した。
  • 3D画像環境(32x32x3)においても、妥当な精度で合成概念の検出と分類に成功し、ベースライン手法を顕著に上回った。
  • SGLDステップ数を固定(K=60)に保ち、関係分類をバッチ処理することで、画像サイズやオブジェクト数の増加に対しても推論時間がほぼ一定を維持し、効率的であった。
  • 同じモデルアーキテクチャとハイパーパrameterを用いて、HD-Letter、HD-Concept、CLEVRといった異なるデータセットへの一般化が可能であった。
  • 関係の内在的変動(例:角度が変化する「鋭い角度」)に対してロバストであることが示され、1つのEBMで多様な例からこのような基本概念を学習した。
  • モデルはドメイン間の概念習得を可能にした:あるドメイン(例:グリッドワールド)で学習した概念は、再訓練なしに別のドメイン(例:3D合成画像)でも同様に検出可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。