Skip to main content
QUICK REVIEW

[论文解读] On the Computability of Solomonoff Induction and Knowledge-Seeking

Jan Leike, Marcus Hütter|arXiv (Cornell University)|Jul 15, 2015
Computability, Logic, AI Algorithms参考文献 16被引用 5
一句话总结

本文分析了在强化学习中索洛蒙诺夫归纳法与知识探索智能体的可计算性,表明虽然归一化的通用先验 $M_{\text{norm}}$ 是极限可计算的,适合实际近似,但非归一化的 ${\overline{M}}$ 及其归一化形式 ${\overline{M}}_{\text{norm}}$ 根本不是极限可计算的。主要贡献是基于拉特莫尔的 BayesExp 构建了一个极限可计算的、弱渐近最优的强化学习智能体,实现了理论最优性,同时保持计算可行性。

ABSTRACT

Solomonoff induction is held as a gold standard for learning, but it is known to be incomputable. We quantify its incomputability by placing various flavors of Solomonoff's prior M in the arithmetical hierarchy. We also derive computability bounds for knowledge-seeking agents, and give a limit-computable weakly asymptotically optimal reinforcement learning agent.

研究动机与目标

  • 确定索洛蒙诺夫归纳法及其变体在皮亚诺算术层级中的可计算性。
  • 解决由于其先验与策略的不可计算性导致 AIXI 与知识探索智能体在实践中不可行的问题。
  • 构建一个既弱渐近最优又极限可计算的强化学习智能体,以实现实际近似。
  • 澄清在知识探索行为背景下,非归一化与归一化通用先验之间的区别。

提出的方法

  • 本文利用皮亚诺算术层级分析了索洛蒙诺夫先验 $M$、其归一化版本 $M_{\text{norm}}$,以及非归一化 ${\overline{M}}$ 和归一化 ${\overline{M}}_{\text{norm}}$ 变体的可计算性。
  • 证明 $M$ 和 $M_{\text{norm}}$ 是极限可计算的($\Delta^{0}_{2}$),而 ${\overline{M}}$ 是 $\Pi^{0}_{2}$-完全的,${\overline{M}}_{\text{norm}}$ 是 $\Delta^{0}_{3}$-完全的,这意味着它们不是极限可计算的。
  • 对于知识探索智能体,证明 $\varepsilon$-最优策略是极限可计算的,而最优策略是 $\Delta^{0}_{3}$-可计算的。
  • 通过将极限可计算策略与 BayesExp 的知识探索组件结合,利用基于阈值的切换机制在知识探索与奖励追求行为之间切换,构建了一个新智能体。
  • 该智能体使用动态阈值 $\varepsilon_t = 2^{-t}$ 平衡探索与利用,确保渐近最优性的同时保持极限可计算性。
  • 该证明依赖于对拉特莫尔的 BayesExp 框架的改进,用收敛至最优值的 $\varepsilon$-最优近似替代非可计算的最优策略。

实验结果

研究问题

  • RQ1索洛蒙诺夫的通用先验 $M$ 及其归一化变体 $M_{\text{norm}}$ 是否是极限可计算的?它们在皮亚诺算术层级中的位置是什么?
  • RQ2非归一化先验 ${\overline{M}}$ 及其归一化形式 ${\overline{M}}_{\text{norm}}$ 是否可计算?若不可计算,其精确复杂度类是什么?
  • RQ3能否使具有熵或信息增益目标的知识探索智能体实现可计算性?其最优策略的复杂度是什么?
  • RQ4能否构建一个既弱渐近最优又极限可计算的强化学习智能体?
  • RQ5能否在不损失渐近最优性的前提下,用 $\varepsilon$-最优近似替代 BayesExp 中的非可计算最优策略?

主要发现

  • 归一化的通用先验 $M_{\text{norm}}$ 是极限可计算的($\Delta^{0}_{2}$),使其适用于预测任务中的实际近似。
  • 非归一化先验 ${\overline{M}}$ 是 $\Pi^{0}_{2}$-完全的,因此不是极限可计算的,表明其评估存在根本性不可计算性。
  • 其归一化形式 ${\overline{M}}_{\text{norm}}$ 是 $\Delta^{0}_{3}$-完全的,处于极限可计算性之外,导致其无法直接计算。
  • 具有 $\varepsilon$-最优策略的知识探索智能体是极限可计算的,而其最优策略是 $\Delta^{0}_{3}$-可计算的。
  • 通过结合动态阈值与 $\varepsilon$-最优策略,构建了一个既极限可计算又弱渐近最优的强化学习智能体。
  • 所构建的智能体通过确保探索步骤的密度趋于零,并使策略值在切萨罗平均意义下收敛至最优值,实现了弱渐近最优性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。