[논문 리뷰] On the Computability of AIXI
이 논문은 AIXI가 행동 선택 시의 결정 불가능한 팽창과 무한 수평 가치 함수 정의로 인해 극한 계산 가능하지 않음을 입증한다. 저자들은 순환 가치 함수를 도입하고 $\epsilon$-최적 정책에 초점을 맞추어, 기대 보상 최대화를 달성하며 무한 수평에서 $\epsilon$-최적성을 확보하는 극한 계산 가능한 AIXI의 변종을 구축한다.
How could we solve the machine learning and the artificial intelligence problem if we had infinite computation? Solomonoff induction and the reinforcement learning agent AIXI are proposed answers to this question. Both are known to be incomputable. In this paper, we quantify this using the arithmetical hierarchy, and prove upper and corresponding lower bounds for incomputability. We show that AIXI is not limit computable, thus it cannot be approximated using finite computation. Our main result is a limit-computable ε-optimal version of AIXI with infinite horizon that maximizes expected rewards.
연구 동기 및 목표
- AIXI의 산술 계층 내에서의 계산 불가능성 수준을 정확히 규명하는 것.
- AIXI의 무한 수평 가치 함수와 행동 선택 시의 팽창 문제로 인해 극한 계산 가능성이 불가능한 근본적 문제를 다루는 것.
- 무한 수평에서 기대 보상을 최대화하는 계산 가능한, $\epsilon$-최적의 AIXI 버전을 개발하는 것.
- 제시된 순환 가치 함수가 환경이 종료될 수 있는 경우에도 기대 보상을 올바르게 계산할 수 있음을 증명하는 것.
제안 방법
- 산술 계층을 사용하여 AIXI 및 관련 에이전트의 계산 가능성을 분류하고, $\Sigma^0_4$-하드 및 $\Sigma^0_3$-하드 수준을 규명한다.
- 반복 정의가 무한 생존 조건에 의존하는 것을 피하기 위해 가치 함수 $W^\pi_\nu$의 순환 정의를 도입한다.
- 반복 가치 함수 $V^\pi_\nu$를 하향 반순환 가능하고 극한 계산 가능성을 보장하는 $W^\pi_\nu$로 대체한다.
- 순환 가치 함수를 AIXI와 AINU에 적용하여 $\epsilon$-최적 정책이 극한 계산 가능해지며 ($\Sigma^0_2$) 됨을 보여준다.
- 수평 $m$에 대해 단조성 보장으로 인해 순환 가치 함수가 기대 보상을 정확히 계산함을 입증한다.
- 하향 반순환 함수는 극한에 대해 닫혀 있음을 이용하여, $\epsilon$-최적 정책에 대한 언제라도 알고리즘을 구성할 수 있음을 보여준다.
실험 결과
연구 질문
- RQ1AIXI는 산술 계층 내에서 정확히 어느 정도의 계산 불가능성을 가지는가?
- RQ2표준 반복 가치 함수가 왜 극한 계산 가능하지 않은가? 이 문제는 해결 가능할 수 있는가?
- RQ3무한 수평에서 기대 보상을 최대화하는 극한 계산 가능하고 $\epsilon$-최적의 AIXI 버전을 구성할 수 있는가?
- RQ4순환 가치 함수 $W^\pi_\nu$는 환경이 종료될 수 있는 경우에도 기대 보상을 정확히 계산하는 데에 충분한가?
- RQ5일반적인 반순환 환경에서 최적 및 $\epsilon$-최적 정책의 계산 하드웨어 경계는 무엇인가?
주요 결과
- AIXI는 극한 계산 가능하지 않으며, 최적 정책에 대해 $\Sigma^0_4$-하드이고, $\epsilon$-최적 정책에 대해 $\Sigma^0_3$-하드이다.
- 반복 가치 함수 $V^\pi_\nu$는 영원히 생존한다는 조건에 의존하므로 결정 불가능하며, 따라서 극한 계산 가능하지 않다.
- 순환 가치 함수 $W^\pi_\nu$는 $\Sigma^0_2$-계산 가능하며, 무한 수평에서 $\epsilon$-기대 보상을 정확히 계산한다.
- $\epsilon$-최적 정책이 순환 가치 함수에 기반할 경우 극한 계산 가능해지며 ($\Sigma^0_2$) 정규 튜링 기계로 근사 가능하다.
- 특정 보편 튜링 기계에 대해 $\epsilon$-최적 순환 AIXI의 계산 복잡도는 $\Sigma^0_1$-하드이며, 히딩 문제만큼 어려운 것으로 나타난다.
- 순환 AIXI 에이전트는 빠른 수렴을 달성한다: $t \to \infty$일 때 $\epsilon(t)$-최적 정책의 가치가 최적 가치로 수렴한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.