Skip to main content
QUICK REVIEW

[論文レビュー] Bounded Recursive Self-Improvement

Eric Nivel, Kristinn R. Þórisson|arXiv (Cornell University)|Dec 24, 2013
Embodied and Extended Cognition参考文献 24被引用数 18
ひとこと要約

本論文は、自己モデル化、自己反省的推論、価値に基づくタスク優先順位付けを通じて、不完全に定義された現実世界の環境において、自律的かつ継続的に性能を向上させる人工系の境界付き再帰的自己改善アーキテクチャを提案する。このシステムは、設計上の制約内で自己改善を実現し、動的かつ優先順位付けされた推論スレッドのスケジューリングにより、リアルタイムのマルチモーダルな人間対話で複雑なタスクのオンライン学習を可能にし、人工汎用知能のスケーラブルな青写真を提供する。

ABSTRACT

We have designed a machine that becomes increasingly better at behaving in underspecified circumstances, in a goal-directed way, on the job, by modeling itself and its environment as experience accumulates. Based on principles of autocatalysis, endogeny, and reflectivity, the work provides an architectural blueprint for constructing systems with high levels of operational autonomy in underspecified circumstances, starting from a small seed. Through value-driven dynamic priority scheduling controlling the parallel execution of a vast number of reasoning threads, the system achieves recursive self-improvement after it leaves the lab, within the boundaries imposed by its designers. A prototype system has been implemented and demonstrated to learn a complex real-world task, real-time multimodal dialogue with humans, by on-line observation. Our work presents solutions to several challenges that must be solved for achieving artificial general intelligence.

研究の動機と目的

  • 不完全に定義された現実世界の環境において、継続的かつ目的志向的な自己改善が可能なシステムの設計。
  • 設計者が定めた境界内で再帰的自己改善を可能にし、制御不能な最適化を回避すること。
  • 並列推論スレッドの動的で価値に基づくスケジューリングメカニズムを実装し、学習と適応の優先順位を付けること。
  • マルチモーダルな人間対話のような複雑な現実世界タスクにおける自律的でオンライン学習の可能性を実証すること。
  • 内部的・反省的・自己触媒的なプロセスを通じて人工汎用知能を達成するためのアーキテクチャ的青写真を提供すること。

提案手法

  • システムは蓄積された経験を用いて自分自身と環境をモデル化し、再帰的自己反省と適応を可能にする。
  • 多数の並列推論スレッドを用い、それぞれが潜在的な行動や推論を表しており、価値に基づくスケジューラーによって動的に優先順位が付けられる。
  • 自己改善は設計上の制約によって境界づけられており、再帰的最適化中に安全かつ安定性を確保する。
  • アーキテクチャは、内発性(内部から目標を生成)、反射性(自己モデル化)、自己触媒性(自己持続的改善ループ)の原則を統合する。
  • リアルタイムでの人間相互作用の観察を用いて、マルチモーダル対話行動を学ぶためのプロトタイプシステムを実装した。
  • 期待される価値と学習進捗に基づいて、スレッド実行を動的に調整する動的優先順位スケジューリングメカニズムを採用している。

実験結果

リサーチクエスチョン

  • RQ1人工系が制限のない最適化を伴わず、不完全に定義された現実世界の環境で再帰的自己改善を達成するにはどうすればよいか?
  • RQ2安全で境界付きかつ継続的な自己改善を実現するための、自律的システムに適したアーキテクチャ的原則は何か?
  • RQ3推論スレッドの価値に基づくスケジューリングが、効果的かつ効率的な自己最適化をどのようにもたらすか?
  • RQ4オンライン観察と自己モデル化を通じて、複雑なリアルタイムの人間対話タスクを学習できるか?
  • RQ5内発性、反射性、自己触媒性は、人工汎用知能の実現にどのように寄与するか?

主な発見

  • システムは、オンライン観察を通じてリアルタイムのマルチモーダルな人間対話の学習に成功し、複雑な現実世界タスクにおける実用的自己改善を実証した。
  • 価値に基づく動的優先順位スケジューラーにより、計算リソースが最も有望な推論スレッドに効率的に割り当てられ、学習が加速した。
  • 予め定められた設計境界内で再帰的自己改善が達成され、最適化中に安全かつ安定性が保証された。
  • 自己モデル化と反省的推論の統合により、経験と内部評価に基づいた行動の適応が可能になった。
  • プロトタイプは、境界付き再帰的自己改善が現実世界の設定で実現可能であることを示し、人工汎用知能への実現可能性のある道筋を提供した。
  • システムのパフォーマンスは時間経過とともに継続的に向上し、リアルタイム対話における対話品質と応答性に測定可能な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。