[论文解读] Learning selection strategies in Buchberger's algorithm
本文提出一种强化学习方法,用于优化布赫斯巴赫算法中计算格罗布纳基时的 S-对选择,采用近端策略优化(PPO)在随机二项式系统上训练智能体。与最先进启发式方法相比,训练后的智能体将多项式加法次数减少了 20–40%,证明了机器学习可显著提升符号计算性能。
Studying the set of exact solutions of a system of polynomial equations largely depends on a single iterative algorithm, known as Buchberger's algorithm. Optimized versions of this algorithm are crucial for many computer algebra systems (e.g., Mathematica, Maple, Sage). We introduce a new approach to Buchberger's algorithm that uses reinforcement learning agents to perform S-pair selection, a key step in the algorithm. We then study how the difficulty of the problem depends on the choices of domain and distribution of polynomials, about which little is known. Finally, we train a policy model using proximal policy optimization (PPO) to learn S-pair selection strategies for random systems of binomial equations. In certain domains, the trained model outperforms state-of-the-art selection heuristics in total number of polynomial additions performed, which provides a proof-of-concept that recent developments in machine learning have the potential to improve performance of algorithms in symbolic computation.
研究动机与目标
- 解决由于 S-对选择不理想导致的布赫斯巴赫算法性能瓶颈。
- 探索强化学习是否能发现格罗布纳基计算中更优的选择策略。
- 将二项式理想确立为符号计算中算法学习的可处理且具有应用相关性的基准领域。
- 评估所学策略在不同多项式分布和系统规模下的泛化能力。
- 研究所学策略在高变量系统和非二项式理想中的可扩展性。
提出的方法
- 将布赫斯巴赫算法形式化为具有状态、动作和奖励组件的强化学习环境。
- 将状态定义为当前的 S-对和多项式集合,动作对应于 S-对的选择。
- 设计基于还原进度和多项式加法次数的密集奖励函数,以指导策略学习。
- 使用近端策略优化(PPO)结合广义优势估计(GAE)进行价值函数自举,训练深度 Q-网络策略。
- 采用简单的前馈神经网络表示策略和价值函数,输入特征编码了单项式的次数和首项。
- 在多个分布(均匀、加权)和系统规模(3-20-10、5-10-10 等)上评估性能。
实验结果
研究问题
- RQ1强化学习能否学习到有效的 S-对选择策略,使其在布赫斯巴赫算法中优于手工设计的启发式方法?
- RQ2所学策略在不同二项式系统分布下的性能泛化能力如何?
- RQ3系统规模和变量数量对所学策略可扩展性的影响是什么?
- RQ4所学策略在非二项式理想上的表现如何?能否适应稀疏多项式系统?
- RQ5通过 GAE 进行价值函数近似是否能显著提升训练稳定性和最终性能?
主要发现
- 在 3-20-10 加权二项式分布上,PPO 训练的智能体相比最佳基准启发式方法,将总多项式加法次数减少了 20–40%。
- 智能体展现出强大的泛化能力,在邻近分布和系统规模下表现具有竞争力,仅在极端分布外设置下性能出现下降。
- 在五变量二项式系统中,智能体在 5-10-10 加权分布上比最佳基准减少了 48% 的加法次数。
- 对于具有稀疏多项式的非二项式理想,智能体表现呈双峰特征:在许多实例上优于所有基准,但在其他实例上表现随机,导致平均性能更差,尽管中位数表现更优。
- 通过 GAE 训练的价值函数是性能提升的关键因素,因为它实现了每一步的完整回溯估计,提升了学习稳定性和收敛性。
- 基于智能体策略推导出的启发式方法 'TrueDegree',在非二项式测试集上的平均性能优于最佳基准 19–33%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。