Skip to main content
QUICK REVIEW

[論文レビュー] Representing Knowledge as Predictions (and State as Knowledge)

Mark Ring|arXiv (Cornell University)|Dec 12, 2021
Philosophy and History of Science被引用数 4
ひとこと要約

本稿では、一般価値関数(GVFs)、すなわち「予測」とも呼ばれるものを使って、人工エージェントが生のセンサモータ経験から直接、抽象的で高次の知識を学習する階層的知識表現フレームワークを提案する。行動に基づいて将来の状態や特徴を再帰的に予測することで、エージェントは、生のピクセルやタッチから、壁、部屋、ドアといった概念に至るまでの段階的な抽象化を構築する。これにより、人間がアノテートした記号を用いずに、経験に基づく直感的な推論が可能になる。

ABSTRACT

This paper shows how a single mechanism allows knowledge to be constructed layer by layer directly from an agent's raw sensorimotor stream. This mechanism, the General Value Function (GVF) or "forecast," captures high-level, abstract knowledge as a set of predictions about existing features and knowledge, based exclusively on the agent's low-level senses and actions. Thus, forecasts provide a representation for organizing raw sensorimotor data into useful abstractions over an unlimited number of layers--a long-sought goal of AI and cognitive science. The heart of this paper is a detailed thought experiment providing a concrete, step-by-step formal illustration of how an artificial agent can build true, useful, abstract knowledge from its raw sensorimotor experience alone. The knowledge is represented as a set of layered predictions (forecasts) about the agent's observed consequences of its actions. This illustration shows twelve separate layers: the lowest consisting of raw pixels, touch and force sensors, and a small number of actions; the higher layers increasing in abstraction, eventually resulting in rich knowledge about the agent's world, corresponding roughly to doorways, walls, rooms, and floor plans. I then argue that this general mechanism may allow the representation of a broad spectrum of everyday human knowledge.

研究の動機と目的

  • 人工知能および認知科学における長年の課題である、高次の知識がセンサモータ経験の現実世界の基盤とどのように結びつくかを解決すること。
  • 物体の性質や空間的配置といった、抽象的で有用な知識が、人間がアノテートした記号を用いずに、低レベルの相互作用から自然に出現できることを示すこと。
  • 将来の状態を予測するモデリングを通じて、段階的で階層的な知識表現を構築するための形式的で段階的なメカニズムを提供すること。
  • このフレームワークが、直感的な物理的および空間的推論を含む、日常的な人間の知識の広範なスケールを表現できることを主張すること。
  • 人間の発達に類似した経験を通じて知識を段階的に発展させる継続的学習システムの基盤として、このアプローチを位置づけること。

提案手法

  • 知識を、現在の観測と行動に基づく将来の特徴や状態に関する予測として表現する一般価値関数(GVFs)、別名「予測」を用いる。
  • 下位層が生の感覚入力(例:ピクセル、タッチ)を処理し、上位層が壁、部屋、ドアといった概念へと抽象化する、階層的・段階的な知識構築法を採用する。
  • 任意の方策(ポリシー)下で学習可能な、再帰的な時系列差分更新メカニズム(式11)を採用し、オフポリシーのデータに対して重要度サンプリングを用いた補正を施す。
  • 予測のターゲットが即時の予測と将来の予測の重み付き組み合わせである、$ f(s) = \beta(s)z(s) + (1 - \beta(s))c(s) + \sum_{s'} P(s, s') f(s') $ という価値関数としての予測を定義することで、安定した学習を可能にする。
  • 「右に壁がある」「部屋の中心へ行く」などの例を含む、構造的な予測、オプション、エイリアスのセットを導入し、原始的行動からより抽象的な表現へと段階的に構築する。
  • 方策に依存しない学習フレームワークを採用しており、オフポリシー学習をサポートすることで、行動方策と目標方策が異なる場合でも、多様な経験から学習可能になる。

実験結果

リサーチクエスチョン

  • RQ1人間がアノテートした記号を用いずに、生のセンサモータデータから、物体の性質や空間的配置といった高次の抽象的知識を直接構築できるか?
  • RQ21つの統一的なメカニズム(GVFs)が、低レベルの感覚入力から段階的で階層的な知識表現をどのように構築できるか?
  • RQ3将来の状態を予測するモデルが、物体の重さ・サイズ・安定性の推定といった、直感的推論の基盤としてどの程度有効に機能するか?
  • RQ4このフレームワークが、環境との継続的相互作用を通じて知識が蓄積され変化する継続的学習をサポートできるか?
  • RQ5多様な経験軌跡から効率的で安定した学習が可能となるように、オフポリシー学習をこのフレームワークにどのように統合できるか?

主な発見

  • このフレームワークは、生のセンサ入力から壁、部屋、ドアといった高次の空間的概念に至るまで、12層の抽象化を成功裏に構築し、人間のような直感的知識への現実的な道筋を示した。
  • GVFsの使用により、エージェントは将来の状態に関する予測として知識を表現でき、想像上の相互作用を通じて物体の性質(例:重さ、柔らかさ)について推論できるようになった。
  • 再帰的更新ルール(式11)は、任意のポリシー下で時系列差分学習を可能にし、行動方策と目標方策が異なる場合でも、安定的かつ効率的な学習を実現した。
  • 重要度サンプリングによる補正を用いたオフポリシー学習が可能であり、実世界の展開において、異なる方策で収集された経験からも実用的かつ安定した学習が可能になった。
  • 単純な予測とオプションの組み合わせにより、複雑で高次の概念(例:「部屋の中心」、「通路の中間」)が自然に出現する仕組みを提供した。
  • このフレームワークは、単なる事実の表現を超えて、バルーンがどのように振る舞うかといった、経験に基づく直感的知識(例:期待)を、明示的な記号符号化なしに表現するメカニズムを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。