Skip to main content
QUICK REVIEW

[論文レビュー] POWERPLAY: Training an Increasingly General Problem Solver by Continually Searching for the Simplest Still Unsolvable Problem

Jürgen Schmidhuber|arXiv (Cornell University)|Dec 22, 2011
Computability, Logic, AI Algorithms参考文献 39被引用数 12
ひとこと要約

PowerPlayは、時間的・空間的に効率的なプログラム探索を用いて、常に最も単純な未解決問題を自ら生成し、それを解けるように解法器を更新することで、一般化された問題解決者を自己教師的に訓練するフレームワークを提案する。この手法はスキルの圧縮と新規性の探求のバランスをとることで、記憶の喪失を伴わず、階層的なスキル習得が発生し、一般化性能が向上する。

ABSTRACT

Most of computer science focuses on automatically solving given computational problems. I focus on automatically inventing or discovering problems in a way inspired by the playful behavior of animals and humans, to train a more and more general problem solver from scratch in an unsupervised fashion. Consider the infinite set of all computable descriptions of tasks with possibly computable solutions. The novel algorithmic framework POWERPLAY (2011) continually searches the space of possible pairs of new tasks and modifications of the current problem solver, until it finds a more powerful problem solver that provably solves all previously learned tasks plus the new one, while the unmodified predecessor does not. Wow-effects are achieved by continually making previously learned skills more efficient such that they require less time and space. New skills may (partially) re-use previously learned skills. POWERPLAY's search orders candidate pairs of tasks and solver modifications by their conditional computational (time & space) complexity, given the stored experience so far. The new task and its corresponding task-solving skill are those first found and validated. The computational costs of validating new tasks need not grow with task repertoire size. POWERPLAY's ongoing search for novelty keeps breaking the generalization abilities of its present solver. This is related to Goedel's sequence of increasingly powerful formal theories based on adding formerly unprovable statements to the axioms without affecting previously provable theorems. The continually increasing repertoire of problem solving procedures can be exploited by a parallel search for solutions to additional externally posed tasks. POWERPLAY may be viewed as a greedy but practical implementation of basic principles of creativity. A first experimental analysis can be found in separate papers [53,54].

研究の動機と目的

  • 人間や動物の遊びにインspiredして、初期状態から段階的に一般化度の高い問題解決者を訓練する実用的で自己教師的なフレームワークの開発。
  • 過去のスキルを保持しつつ新たなスキルを習得する継続的学習の課題に対処すること。
  • 2つの相反する力のバランスを取ること:既存のスキルの圧縮・改善(オッカムの剃刀に準拠)と、現在の一般化を破る新しいタスクの発明(イノベーションを促進)。
  • 過去に解決されたタスクが一切忘れられないことを保証する形式的でアルゴリズム的なメカニズムを提供すること。
  • 自己発案されたタスクが、神経的または記号的アーキテクチャにおいて階層的で再利用可能なスキルの出現をどのように促進するかを探索すること。

提案手法

  • PowerPlayは、時間的・空間的に最適な方法で、過去の経験に基づく条件付き計算複雑度(時間および空間)が最小となるペアを優先して、可能な新規タスクとそれに対応する解法器の変更の空間を貪欲に探索する。
  • 正しさの検証に証明探索機構を用い、変更された解法器がすべての以前に学習済みタスクと新しいタスクを解けることを保証するとともに、元の解法器が新しいタスクを解けないことを確認する。
  • 前缀コードに基づく問題解決器を採用することで、スキルの効率的表現と再利用を可能にし、階層的学習と圧縮を支援する。
  • 解の記述長を最小化する圧縮ドライブを統合し、MDL/MMLの原則に従って一般化性能を向上させる。
  • システムは、内部のプログラム確率分布を動的に調整し、新しいタスクを効率的かつコンactに解けるプログラムを優遇する。
  • 決定的(例:OOPSベース)および確率的/進化的な実装を両方サポートし、さまざまな問題解決器アーキテクチャに柔軟に対応可能である。

実験結果

リサーチクエスチョン

  • RQ1外部の報酬や事前に定義されたタスクなしに、自己教師的・自己教師的でない方法で一般化された問題解決者をどのように訓練できるか?
  • RQ2継続的学習とスキル習得の過程で、過去に学習したスキルがどのように保持されるのかを保証するメカニズムは何か?
  • RQ3既存の解法を圧縮する(効率性を向上)ことと、新しいタスクを発明する(一般化を破りイノベーションを促進)ことの間で、どのようにトレードオフを取るべきか?
  • RQ4最も単純で未解決の問題を継続的に探すことによって、どのように階層的で再利用可能なスキル構造が出現し、一般化性能が向上するのか?
  • RQ5PowerPlayのアプローチは、ゲーデルのより強力な形式的体系の系列という論理の基礎的概念とどのように関係しているか?

主な発見

  • PowerPlayは、変更された解法器がすべての過去のタスクを証明的に解ける一方で、元の解法器が新しいタスクを解けないことを要件としているため、過去に学習したタスクが一切忘れられないことを保証する。
  • 圧縮と効率性を重視する貪欲な探索により、コンパクトで効率的な解法が優先され、階層的で再利用可能なスキルの出現が可能になり、一般化性能が向上する。
  • 短い、より効率的なプログラムを優遇する圧縮ドライブと、新しいタスクを発明する新規性ドライブを組み合わせることで、停滞を防ぎ、継続的な改善を実現する動的なバランスを達成する。
  • 実験結果から、PowerPlayは学習の段階的発達段階を示しており、スキルが単純なものから複雑なものへと進化し、自己発案タスクおよび外部タスクの両方に対する解決効率が向上していることが明らかになった。
  • システムの振る舞いは、未解決の命題を公理として追加することで論理的パワーを拡張するが、以前の定理を無効にしないゲーデルのより強力な形式的理論の系列と形式的に類似している。
  • フレームワークはアーキテクチャの選択に対して頑健であり、最適順序問題解決器(OOPS)ベース、再帰的ニューラルネットワーク、および進化的・確率的プログラム探索に基づく実装を両方ともサポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。