Skip to main content
QUICK REVIEW

[論文レビュー] Object Files and Schemata: Factorizing Declarative and Procedural Knowledge in Dynamical Systems

Anirudh Goyal, Alex Lamb|arXiv (Cornell University)|Jun 29, 2020
Topic Modeling参考文献 24被引用数 16
ひとこと要約

この論文は、動的環境における記述的知識(オブジェクトファイルによるオブジェクト状態)と手順的知識(スキーマによるダイナミクス)を因子化するニューラルネットワークアーキテクチャである scoff を提案する。アテンションに基づくスキーマおよびオブジェクトファイルの選択を用い、同じオブジェクトタイプの複数のインスタンスにわたる体系的汎化を達成し、顕著な遮蔽が伴う直感的物理学ベンチマークにおいて、最先端のモデルを上回る性能を発揮する。

ABSTRACT

Modeling a structured, dynamic environment like a video game requires keeping track of the objects and their states declarative knowledge) as well as predicting how objects behave (procedural knowledge). Black-box models with a monolithic hidden state often fail to apply procedural knowledge consistently and uniformly, i.e., they lack systematicity. For example, in a video game, correct prediction of one enemy's trajectory does not ensure correct prediction of another's. We address this issue via an architecture that factorizes declarative and procedural knowledge and that imposes modularity within each form of knowledge. The architecture consists of active modules called object files that maintain the state of a single object and invoke passive external knowledge sources called schemata that prescribe state updates. To use a video game as an illustration, two enemies of the same type will share schemata but will have separate object files to encode their distinct state (e.g., health, position). We propose to use attention to determine which object files to update, the selection of schemata, and the propagation of information between object files. The resulting architecture is a drop-in replacement conforming to the same input-output interface as normal recurrent networks (e.g., LSTM, GRU) yet achieves substantially better generalization on environments that have multiple object tokens of the same type, including a challenging intuitive physics benchmark.

研究の動機と目的

  • 複数の類似オブジェクトの軌道を予測する際、ブラックボックス型再帰モデルにおける体系的汎化の欠如に対処すること。
  • 恒久的なオブジェクト状態(記述的知識)と行動ルール(手順的知識)を分離することで、構造的で動的な環境をモデル化すること。
  • オブジェクト状態をアクティブなオブジェクトファイルに封入し、ダイナミクスを再利用可能なスキーマに封入することで、モularity と解釈可能性を実現すること。
  • 特に遮蔽下においても、同じオブジェクトタイプの複数のトークンを含む環境での汎化を向上させること。
  • 知識の因子化が、視覚的動的環境におけるより強固で効率的な学習をもたらすことを示すこと。

提案手法

  • モデルは、位置、速度、その他のプロパティを含む、個々のオブジェクトの恒久的状態を保持するアクティブなオブジェクトファイル(of)を用いる。
  • スキーマは受動的で共有されたパラメータであり、オブジェクト状態の時間的変化を定義する。たとえば物理的ダイナミクスや行動ルールがこれに該当する。
  • アテンション機構により、入力に基づいて関連するオブジェクトファイルとスキーマを選択し、オブジェクトファイル間での情報の動的ルーティングを可能にする。
  • オブジェクトファイルは空間的アテンションにより競合し、入力の異なる領域に注目することで、状態更新に最も関連する情報を選択する。
  • アーキテクチャは、標準的なRNN(例:LSTM、GRU)のドロップインリプレースメントであり、同じ入出力インターフェースを維持する。
  • モデルはアテンションを通じて特定のスキーマをオブジェクトファイルにバインドする学習を行い、同一オブジェクトタイプにわたる体系的行動を実現する。

実験結果

リサーチクエスチョン

  • RQ1記述的知識と手順的知識を因子化することで、同じオブジェクトタイプの複数のインスタンスにわたる体系的汎化が神経ネットワークアーキテクチャによって達成可能か?
  • RQ2オブジェクト状態(オブジェクトファイル)とダイナミクス(スキーマ)を分離することで、動的視覚環境における汎化が向上するか?
  • RQ3アテンション機構は、オブジェクトファイル間およびスキーマ選択のための情報ルーティングを効果的に実行できるか?
  • RQ4オブジェクトの持続性やダイナミクスを推定するのが困難な、顕著な遮蔽下でもモデルの性能はいかがなものか?
  • RQ5過剰なスキーマが提供された場合、無効なコンponentが残るか、それともモデルは必要最小限のもののみを適応的に使用するか?

主な発見

  • 遮蔽付きの直感的物理学ベンチマークにおいて、scoff は O1 タスク(消えるボール)で相対分類誤差 0.34 ± 0.05 を達成し、先行モデルを上回った。
  • O2 タスク(形状変化)では、scoff が 0.35 ± 0.05 の誤差を記録し、ベースラインモデルを著しく下回った。
  • O3 タスク(テレポート)では、scoff が 0.42 ± 0.02 の誤差を記録し、再び競合モデルを上回った。
  • n_s = 10 のスキーマを用いた場合、訓練中に実際に使用されたのは3〜4つにとどまり、パフォーマンスに劣化を来さずに効率的なリソース利用が確認された。
  • モデルに「死んだ」スキーマの兆候は一切認められず、過剰な容量に対しても安定した学習が行われ、局所最適解の問題がないことが示された。
  • scoff は体系的汎化を示した:Pac-Manにおける1体のゴーストの正しく予測された挙動は、同じタイプの他のゴーストに対しても正しく予測されることを示唆した。これは共有されたスキーマのおかげである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。