[论文解读] Evolving winning strategies for Nim-like games
本文提出一种基于多表达编程(MEP)的进化方法,用于自动发现类似尼姆游戏的获胜策略。通过演化能够将游戏局面分类为P-位置(输局)或N-位置(赢局)的数学表达式,该方法成功学习到了尼姆游戏中标准的异或(XOR)获胜条件,在多种实验配置下均取得了高成功率。
An evolutionary approach for computing the winning strategy for Nim-like games is proposed in this paper. The winning strategy is computed by using the Multi Expression Programming (MEP) technique - a fast and efficient variant of the Genetic Programming (GP). Each play strategy is represented by a mathematical expression that contains mathematical operators (such as +, -, *, mod, div, and , or, xor, not) and operands (encoding the current game state). Several numerical experiments for computing the winning strategy for the Nim game are performed. The computational effort needed for evolving a winning strategy is reported. The results show that the proposed evolutionary approach is very suitable for computing the winning strategy for Nim-like games.
研究动机与目标
- 开发一种无需依赖先验理论知识的进化方法,用于发现类似尼姆游戏的获胜策略。
- 将多表达编程(MEP)作为传统遗传编程在博弈论符号回归中的快速高效替代方案。
- 演化出能够正确将尼姆游戏的状态分类为P-位置(输局)或N-位置(赢局)的数学表达式。
- 评估关键算法参数——种群大小、代数和染色体长度——对获胜策略发现成功率的影响。
- 展示该方法在基于P/N-位置理论的其他公平博弈中的可扩展性。
提出的方法
- 种群中的每个个体以固定长度的染色体表示,其中每个基因编码一个终结符(游戏状态变量)或一个函数(例如,+、-、*、xor、mod、and、or、not)。
- MEP表示法采用线性、基于栈的编码方式,函数参数通过索引引用,确保语法正确性,并支持每条染色体高效评估多个表达式。
- 根据演化表达式在(4,4,4,4)尼姆游戏中对全部70种唯一游戏配置正确分类为P-或N-位置的准确性来分配适应度。
- 进化过程采用二元锦标赛选择,交叉概率为0.9,每条染色体进行2次突变,以维持多样性并引导收敛。
- 搜索目标是使表达式对P-位置返回0,对N-位置返回非零值,从而有效解决具有二元分类目标的符号回归任务。
- 该方法通过遍历博弈树动态识别P/N-位置,避免了对预标注数据集的依赖。
实验结果
研究问题
- RQ1多表达编程能否在不了解Grundy-Sprague理论的前提下,演化出正确且可推广的尼姆游戏获胜策略?
- RQ2种群大小、代数和染色体长度如何影响获胜策略发现的成功率?
- RQ3所演化出的表达式是否能匹配或超越已知的基于异或(XOR)的尼姆游戏解法?
- RQ4基于MEP的方法在具有P/N-位置结构的其他公平博弈中是否具备可扩展性和有效性?
- RQ5当理论解法事先未知时,演化计算在组合博弈中发现符号规则的程度如何?
主要发现
- 当种群大小为140时,方法在50次运行中取得了37次成功,表明种群大小与成功率之间存在强烈正相关性。
- 在100代后,50次运行中有41次成功发现获胜策略,表明在标准设置下具有高度的收敛稳定性。
- 最优染色体长度被确定为35个基因,50次运行中成功25次,表明表达式复杂性与搜索效率之间存在权衡。
- MEP成功演化出其他正确的公式,例如 $a_1 \text{ xor } a_2 \text{ xor } a_3 - a_4$,由于异或运算符的性质,这些公式在数学上是有效的。
- 即使在极简配置(如20个个体)下,该方法仍能取得高成功率,显示出在小规模搜索空间中的鲁棒性与高效性。
- 该方法可推广至其他依赖P/N-位置分类的公平博弈,因为博弈树遍历和状态评估的底层逻辑具有可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。