Skip to main content
QUICK REVIEW

[论文解读] Asymptotically Optimal Agents

Tor Lattimore, Marcus Hütter|arXiv (Cornell University)|Jul 27, 2011
Computability, Logic, AI Algorithms参考文献 7被引用 9
一句话总结

本文研究了在确定性可计算环境中渐近最优智能体的存在性,定义了渐近最优性的强形式与弱形式。证明了不存在可计算的智能体是强渐近最优的,但对于某些折扣函数(如几何折扣),存在不可计算的弱渐近最优智能体,通过定制的探索计划实现探索与利用的平衡。

ABSTRACT

Artificial general intelligence aims to create agents capable of learning to solve arbitrary interesting problems. We define two versions of asymptotic optimality and prove that no agent can satisfy the strong version while in some cases, depending on discounting, there does exist a non-computable weak asymptotically optimal agent.

研究动机与目标

  • 对序列决策设置中智能体的渐近最优性定义——强与弱形式进行形式化与分析。
  • 确定在各种折扣函数下,渐近最优智能体是否可能存在于确定性可计算环境类中。
  • 研究探索在实现长期最优性中的作用,特别是智能体能否在不牺牲渐近性能的前提下学习真实环境。
  • 通过证明在该类环境中静态贝叶斯智能体甚至无法实现弱渐近最优性,扩展了关于AIXI和贝叶斯智能体的先前结果。
  • 根据是否在可计算环境中允许存在弱渐近最优策略,对折扣函数进行分类。

提出的方法

  • 引入两种定义:强渐近最优性要求智能体在极限下停止探索并执行最优行为;弱渐近最优性允许持续但逐渐减少的探索。
  • 构建一个不可计算的智能体,其使用可计算的探索计划,确保足够探索以学习真实环境,同时保持长期最优性。
  • 应用折扣函数来建模智能体的前瞻性行为,关键洞见在于折扣函数的选择决定了弱渐近最优性是否可实现。
  • 采用基于模型的强化学习框架,智能体维护一组候选环境,并使用可计算环境上的先验更新信念。
  • 借鉴多臂赌博机算法(如UCB)和ε-贪婪探索的技术,确保探索足够频繁以学习真实环境,但又不至于频繁到造成性能损失。
  • 采用基于构造反例环境的证明策略,迫使任何智能体要么探索不足,要么牺牲长期性能。

实验结果

研究问题

  • RQ1可计算智能体是否可能在确定性可计算环境类中实现强渐近最优性?
  • RQ2在哪些折扣函数下,弱渐近最优智能体存在于确定性可计算环境类中?
  • RQ3能否构造一个在几何折扣下为弱渐近最优的不可计算智能体?
  • RQ4AIXI为何无法实现弱渐近最优性?通过增加探索组件能否纠正这一失败?
  • RQ5弱渐近最优性结果能否推广至随机可计算环境?

主要发现

  • 无论采用何种折扣函数,不存在可计算智能体能成为确定性可计算环境类中的强渐近最优智能体。
  • 对于几何折扣及其他可求和的折扣函数,存在不可计算的弱渐近最优智能体,证明了弱渐近最优性在原则上是可实现的。
  • 弱渐近最优智能体的存在性在很大程度上依赖于折扣函数;对于某些函数,即使不可计算智能体也无法实现弱渐近最优性。
  • AIXI无法实现弱渐近最优性的原因在于其最终会停止探索,这在某些情况下会阻止其学习真实环境。
  • 所提出的智能体通过确保探索以递减频率但足够深入的方式发生,实现了探索与利用之间的平衡,从而识别真实环境。
  • 结果表明,即使在可计算环境类中,静态贝叶斯智能体也无法实现弱渐近最优性,这挑战了关于一般环境中贝叶斯学习的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。