Skip to main content
QUICK REVIEW

[論文レビュー] From pixels to planning: scale-free active inference

Karl Friston, Conor Heins|arXiv (Cornell University)|Jul 27, 2024
Computability, Logic, AI Algorithms被引用数 4
ひとこと要約

この論文は、部分的に観測可能なマルコフ意思決定過程を、経路を潜在変数として扱うことで拡張するスケール不変で離散的な状態空間フレームワーク、正規化生成モデル(RGM)を導入する。変分推論と正規化群の原則を用いることで、空間的・時間的スケールに依存しない階層的・構成的表現のエンドツーエンド学習が可能となり、画像分類、動画・音楽生成、アーケードゲームに類似した環境の計画といった応用で、アーキテクチャに偏りのないスケールフリーな階層的推論を達成する。

ABSTRACT

This paper describes a discrete state-space model -- and accompanying methods -- for generative modelling. This model generalises partially observed Markov decision processes to include paths as latent variables, rendering it suitable for active inference and learning in a dynamic setting. Specifically, we consider deep or hierarchical forms using the renormalisation group. The ensuing renormalising generative models (RGM) can be regarded as discrete homologues of deep convolutional neural networks or continuous state-space models in generalised coordinates of motion. By construction, these scale-invariant models can be used to learn compositionality over space and time, furnishing models of paths or orbits; i.e., events of increasing temporal depth and itinerancy. This technical note illustrates the automatic discovery, learning and deployment of RGMs using a series of applications. We start with image classification and then consider the compression and generation of movies and music. Finally, we apply the same variational principles to the learning of Atari-like games.

研究の動機と目的

  • 長距離の時間的・空間的構成性をサポートするスケール不変で階層的な生成モデルの開発。
  • 離散的状態空間フレームワークにおいて経路を潜在変数として扱うことで、アクティブインファレンスの枠組みで知覚と計画を統合すること。
  • アーキテクチャのインダクティブバイアスなしに、センサー入力(画像、動画、音楽、ゲーム)の構成的構造の自動発見と学習を可能にすること。
  • 静的画像分類から、アーケードゲームに類似した環境における動的で逐次的な意思決定まで、多様な分野への適用可能性を実証すること。
  • 正規化群にインspiredされた階層的抽象化を通じて、深層学習アーキテクチャとアクティブインファレンスの間の正式な関係を確立すること。

提案手法

  • 潜在変数が経路または軌道を表す離散的状態空間モデルを提案し、部分的に観測可能なマルコフ意思決定過程を拡張する。
  • 自由エネルギー最小化を用いた変分推論を採用し、潜在的経路と状態の近似的ベイズ推論を実行する。
  • 空間的・時間的スケールにわたる表現の階層的粗粒度化に、正規化群(RG)の原則を適用する。
  • 反復的な粗粒度化と再構成を通じて構成的特徴を学ぶ階層的・多段階の生成モデルを構築する。
  • 知覚と計画の両方を経路推論を通じてサポートする統合型アクティブインファレンスエンジンにフレームワークを統合する。
  • 一般化座標を用いて、スケール不変な方法で連続的ダイナミクスを離散的にモデル化する。

実験結果

リサーチクエスチョン

  • RQ1同一のスケールフリーな生成モデルは、画像、動画、音楽、ゲーム環境など多様なモodalitiesにわたる階層的表現を学習できるか?
  • RQ2経路または軌道推論を生成モデルの潜在変数として統合することで、知覚と計画の両方をサポートできるか?
  • RQ3正規化群の原則を用いて、アーキテクチャのバイアスなしに階層的かつ構成的構造の表現を構築できるか?
  • RQ4同一の変分推論フレームワークが、動的環境における生成モデリングと意思決定の両方をサポートできるか?
  • RQ5モデルのスケール不変性が、異なる時間的・空間的スケールにわたるロバストな学習と一般化をどのように可能にするか?

主な発見

  • RGMフレームワークは、最小限のインダクティブバイアスで、生のピクセルから階層的かつ構成的な表現を学習し、エンドツーエンドの画像分類を実現した。
  • 経路推論を通じて長距離の時間的依存関係を学習することで、動画および音楽シーケンスの効果的な圧縮と生成が達成された。
  • アーケードゲームに類似した環境では、自由エネルギーを最小化する最適な行動シーケンス(経路)を推論することで計画を学習し、意思決定におけるアクティブインファレンスを示した。
  • 階層的構造により、粗いレベルでは抽象的で長時間スケールのダイナミクスを捉え、細かいレベルでは局所的詳細を保持するスケールフリーな推論が可能となった。
  • スケールおよび解像度に内在する不変性のおかげで、分布シフトに対してロバストであり、タスク間の一般化が可能であることが示された。
  • 正規化群の原則の使用により、時間的・空間的解像度の複数のレベルにわたる体系的抽象化が可能となり、固定されたアーキテクチャを持たない深層ネットワークの階層に類似した抽象化を再現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。