Skip to main content
QUICK REVIEW

[论文解读] KnightCap: A chess program that learns by combining TD(lambda) with game-tree search

Jonathan Baxter, Andrew Tridgell|ArXiv.org|Jan 10, 1999
Artificial Intelligence in Games参考文献 9被引用 15
一句话总结

本文提出TDLeaf(λ),一种新颖的时间差分学习算法,通过在在线对弈过程中从极小化搜索树的叶节点学习,训练国际象棋程序的评估函数。KnightCap使用TDLeaf(λ),在三天内通过与互联网国际象棋服务器上的真实人类和计算机对手对弈308盘,从1650分提升至2150分,证明了在国际象棋等确定性游戏中,在线非自对弈学习的有效性。

ABSTRACT

In this paper we present TDLeaf(lambda), a variation on the TD(lambda) algorithm that enables it to be used in conjunction with game-tree search. We present some experiments in which our chess program ``KnightCap'' used TDLeaf(lambda) to learn its evaluation function while playing on the Free Internet Chess Server (FICS, fics.onenet.net). The main success we report is that KnightCap improved from a 1650 rating to a 2150 rating in just 308 games and 3 days of play. As a reference, a rating of 1650 corresponds to about level B human play (on a scale from E (1000) to A (1800)), while 2150 is human master level. We discuss some of the reasons for this success, principle among them being the use of on-line, rather than self-play.

研究动机与目标

  • 为解决在国际象棋等确定性深度搜索游戏中,使用时间差分学习训练有效评估函数的挑战。
  • 克服自对弈在确定性游戏中导致的重复、非多样化对局序列及泛化能力差的局限性。
  • 开发一种方法,实现在线真实对手学习,以改善探索并加速国际象棋程序强化学习的收敛速度。
  • 探究是否通过多样化的真实人类和计算机对手学习,能比自对弈实现更快、更高质量的策略改进。

提出的方法

  • TDLeaf(λ)通过基于极小化搜索树主变体中的叶节点更新评估函数,扩展了TD(λ),而非基于游戏状态。
  • 该算法在叶位评估上使用时间差分更新,并利用资格迹高效更新特征权重。
  • KnightCap的线性评估函数在在线对弈过程中实时训练,每盘游戏结束后使用TD(λ)更新规则对主变体叶节点进行权重调整。
  • 系统使用丰富的棋盘表示来计算复杂的位置特征,即使计算较慢,也能实现高质量评估。
  • 学习发生于实际对弈的公共服务器(FICS和ICC)上,使KnightCap接触到多样化且非冗余的对手策略。
  • 该方法通过利用真实对手对弈中固有的探索性,避免了过早收敛,提供了多样化且信息丰富的对局状态。

实验结果

研究问题

  • RQ1时间差分学习能否在国际象棋等确定性棋盘游戏中有效应用于深度极小化搜索,其中自对弈会导致探索不足?
  • RQ2在国际象棋评估函数训练中,在线对真实人类和计算机对手学习是否比自对弈实现更快、更优的收敛?
  • RQ3初始权重值的选择如何影响基于TD(λ)的评估函数的学习速度与质量?
  • RQ4λ参数在学习过程中如何平衡即时奖励预测与长期价值估计?
  • RQ5通过TDLeaf(λ)训练的线性评估函数是否能在较少对局数内达到大师级水平?

主要发现

  • KnightCap在FICS上仅用308盘对局和三天在线对弈,从1650分(B级人类水平)提升至2150分(大师级)。
  • 性能提升速度显著快于自对弈实验,后者在600盘后仅对FICS训练版本取得11%的胜率。
  • 从零初始化权重开始,KnightCap在短时间内实现500分的评分提升,表明其从真实对手对弈中学习效率极高。
  • 将权重初始化为兵的价值(1250分),导致提升速度极慢(1000盘后仅达约1550分),凸显了良好初始条件的重要性。
  • 与自对弈相比,在线对弈提供了更丰富、更多样化的经验,有效解决了确定性游戏中固有的探索问题。
  • TDLeaf(λ)成功使线性评估函数通过与真实对手互动学习复杂位置特征,无需深度神经网络即可实现大师级表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。