[논문 리뷰] POWERPLAY: Training an Increasingly General Problem Solver by Continually Searching for the Simplest Still Unsolvable Problem
PowerPlay는 시간 및 공간 효율적인 프로그램 탐색을 사용하여 지속적으로 가장 단순한 풀 수 없는 문제를 자율적으로 창출하고, 이를 해결할 수 있도록 솔버를 갱신함으로써 일반 문제 해결자를 훈련하기 위한 자기지도 학습 프레임워크를 제안한다. 이 방법은 기술 압축과 새로운 일화 탐색을 균형 있게 조율하여 임의의 지식을 상실하지 않으면서도 히에라르키컬한 기술 습득과 일반화 능력 향상을 이룬다.
Most of computer science focuses on automatically solving given computational problems. I focus on automatically inventing or discovering problems in a way inspired by the playful behavior of animals and humans, to train a more and more general problem solver from scratch in an unsupervised fashion. Consider the infinite set of all computable descriptions of tasks with possibly computable solutions. The novel algorithmic framework POWERPLAY (2011) continually searches the space of possible pairs of new tasks and modifications of the current problem solver, until it finds a more powerful problem solver that provably solves all previously learned tasks plus the new one, while the unmodified predecessor does not. Wow-effects are achieved by continually making previously learned skills more efficient such that they require less time and space. New skills may (partially) re-use previously learned skills. POWERPLAY's search orders candidate pairs of tasks and solver modifications by their conditional computational (time & space) complexity, given the stored experience so far. The new task and its corresponding task-solving skill are those first found and validated. The computational costs of validating new tasks need not grow with task repertoire size. POWERPLAY's ongoing search for novelty keeps breaking the generalization abilities of its present solver. This is related to Goedel's sequence of increasingly powerful formal theories based on adding formerly unprovable statements to the axioms without affecting previously provable theorems. The continually increasing repertoire of problem solving procedures can be exploited by a parallel search for solutions to additional externally posed tasks. POWERPLAY may be viewed as a greedy but practical implementation of basic principles of creativity. A first experimental analysis can be found in separate papers [53,54].
연구 동기 및 목표
- 인간과 동물의 놀이를 영감으로 삼아, 처음부터 점차 일반화되는 문제 해결자를 훈련하기 위한 실용적이고 비지도 학습 기반의 프레임워크 개발.
- 기존 기술을 유지하면서 새로운 기술을 습득하는 데서 성능 저하가 발생하지 않는 지속적 학습의 과제 해결.
- 압축 및 향상된 기존 기술(오카무의 면도날 원칙에 기반)과 현재 일반화 능력을 깨는 새로운 과제 창출 간의 상반된 힘을 균형 있게 조절하는 것.
- 이전에 해결된 과제가 기억 상실되지 않는 것을 보장하는 공식적이고 알고리즘 기반의 메커니즘 제공 — 후방 호환성 보장과 함께 점진적인 문제 해결 능력 향상 보장.
- 자기 창출된 과제가 히에라르키컬하고 재사용 가능한 기술의 기원을 이끌어내고 신경망 또는 기호적 아키텍처에서의 일반화 능력을 향상시키는 방식 탐색.
제안 방법
- PowerPlay는 이전 경험을 바탕으로 조건부 계산 복잡도(시간 및 공간)가 가장 낮은 과제와 해당 솔버 수정 조합을 우선순위로 하여, 탐색 공간에서 탐욕적이고 시간 최적화된 방식으로 새로운 과제와 솔버 수정을 탐색한다.
- 정확도 검증을 위해 증명 탐색 기반 메커니즘을 사용하여, 수정된 솔버가 이전에 학습한 모든 과제와 새로운 과제를 해결할 수 있고, 원래 솔버는 새로운 과제를 해결할 수 없음을 보장한다.
- 프리픽스 코드 기반 문제 솔버를 활용하여 기술의 효율적 표현과 재사용을 가능하게 하며, 히에라르키컬 학습과 압축을 지원한다.
- 솔루션의 기술 길이를 최소화하는 압축 드라이브를 통합하여 MDL/MML 원칙과 일치시켜 일반화 능력을 향상시킨다.
- 시스템은 내부 프로그램 확률 분포를 동적으로 조정하여 새로운 과제를 효율적이고 압축적으로 해결할 수 있는 프로그램을 선호한다.
- 정적(예: OOPS 기반) 및 확률적/진화적 구현 방식을 모두 지원하여 다양한 문제 솔버 아키텍처에 유연성을 제공한다.
실험 결과
연구 질문
- RQ1외부 보상이나 사전 정의된 과제 없이, 어떻게 일반 문제 해결자를 자기지도 학습 방식으로 훈련시킬 수 있는가?
- RQ2지속적 학습 과정에서 이전에 학습한 기술이 어떻게 보존되는가?
- RQ3기존 솔루션을 압축하는 것(효율성 향상)과 새로운 과제를 창출하는 것(일반화 능력 깨뜨림으로써 혁신 유도) 사이의 상충 관계를 어떻게 균형 있게 조절할 수 있는가?
- RQ4가장 단순한 풀 수 없는 문제를 지속적으로 탐색하는 방식이 어떻게 히에라르키컬한 기술 체계의 기원과 일반화 능력 향상을 이끌어내는가?
- RQ5PowerPlay의 접근 방식은 고델의 점차 강력해지는 형식 체계의 시퀀스와 어떻게 관련이 있는가?
주요 결과
- PowerPlay는 수정된 솔버가 이전에 학습한 모든 과제를 증명 가능하게 해결하고, 원래 솔버는 새로운 과제를 해결할 수 없음을 요구함으로써 이전에 학습한 과제가 기억 상실되지 않음을 보장한다.
- 압축된, 효율적인 솔루션을 우선시하는 탐욕적 탐색을 통해, 히에라르키컬하고 재사용 가능한 기술의 기원이 발생하며, 이로 인해 일반화 능력 향상이 이루어진다.
- 짧고 효율적인 프로그램을 선호하는 압축 드라이브와 새로운 과제를 창출하는 뉴어티 드라이브를 결합함으로써, 정체를 방지하고 지속적인 개선을 이끌어내는 동적 균형을 달성한다.
- 실험 결과에 따르면, PowerPlay는 학습 과정에서 순차적인 발달 단계를 보이며, 기술이 단순한 것에서 복잡한 것으로 진화하고, 자기 창출 과제와 외부 과제 모두에 대해 점차 효율적으로 해결하는 능력이 향상됨을 보여준다.
- 시스템의 행동은 고델의 점차 강력해지는 형식 이론의 시퀀스와 공식적으로 유사하며, 증명 불가능한 문장이 축약된 공리로 추가되어 이전 정리가 무효화되지 않도록 하면서 논리적 능력을 확장한다.
- 프레임워크는 아키텍처 선택에 대해 강건하며, 최적 순서 기반 문제 솔버(OOPS), 순환 신경망, 진화적 또는 확률적 프로그램 탐색 기반의 구현을 모두 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.