QUICK REVIEW
[论文解读] Evolution of Neural Networks to Play the Game of Dots-and-Boxes
Lex Weaver, Terry Bossomaier|ArXiv.org|Sep 28, 1998
Artificial Intelligence in Games参考文献 8被引用 7
一句话总结
本文提出通过演化人工神经网络来玩无已知最优解的Dots-and-Boxes游戏。采用共进化训练方法,网络通过游戏过程学习推荐强策略,而非预测最终结果,相比使用启发式规则作为规则库的反向传播训练网络,展现出更优的泛化能力。
ABSTRACT
Dots-and-Boxes is a child's game which remains analytically unsolved. We implement and evolve artificial neural networks to play this game, evaluating them against simple heuristic players. Our networks do not evaluate or predict the final outcome of the game, but rather recommend moves at each stage. Superior generalisation of play by co-evolved populations is found, and a comparison made with networks trained by back-propagation using simple heuristics as an oracle.
研究动机与目标
- 开发无需依赖显式游戏结果评估的神经网络,以学习玩Dots-and-Boxes游戏。
- 探究共进化神经网络是否能比通过反向传播并辅以启发式指导训练的网络实现更好的泛化能力。
- 在竞争环境中评估演化网络与简单启发式玩家的性能表现。
- 探索使用进化计算训练具有复杂战略深度且无已知最优策略的游戏智能体的可行性。
提出的方法
- 使用共进化算法训练神经网络,玩家在重复的Dots-and-Boxes对局中相互竞争。
- 每个网络在每个游戏状态下输出一步走法建议,而不估计最终游戏结果。
- 训练过程基于游戏表现评估,而非使用带标签示例的反向传播。
- 性能与使用启发式规则作为规则库的反向传播训练网络进行对比。
- 网络架构为前馈网络,未明确描述隐藏层,但学习机制强调策略演化而非价值预测。
- 进化选择基于网络间在锦标赛式对局中的胜率。
实验结果
研究问题
- RQ1共进化神经网络是否能在Dots-and-Boxes游戏中表现优于反向传播训练的网络?
- RQ2训练神经网络以推荐走法而非预测结果,是否能在此游戏中带来更好的泛化能力?
- RQ3进化计算能否有效训练出适用于无已知最优策略游戏的智能体?
- RQ4在胜率和适应性方面,演化网络与简单启发式玩家相比表现如何?
主要发现
- 与使用启发式规则库的反向传播训练网络相比,共进化神经网络展现出更优的泛化能力。
- 演化网络能够在不显式评估最终游戏结果的情况下,学习到强而有策略的走法。
- 在竞争性对局中观察到性能提升,表明通过进化有效学习了游戏特异性战术。
- 进化训练实现了稳定的收敛,表明在学习复杂走法选择方面具有鲁棒性。
- 结果表明,对于具有高战略复杂度的游戏,进化训练是监督学习结合启发式标签的一种可行替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。