[论文解读] Multi-agent Dynamic Algorithm Configuration
本文提出多智能体动态算法配置(MA-DAC),一种协作式多智能体强化学习框架,可动态调整复杂优化算法中的多个异构超参数。通过将每种超参数类型建模为上下文感知多智能体马尔可夫决策过程(MMDP)中的独立智能体,MA-DAC 在 MOEA/D 上优于启发式规则、多臂赌博机和单智能体强化学习方法,展现出更优的性能与跨问题类别的泛化能力。
Automated algorithm configuration relieves users from tedious, trial-and-error tuning tasks. A popular algorithm configuration tuning paradigm is dynamic algorithm configuration (DAC), in which an agent learns dynamic configuration policies across instances by reinforcement learning (RL). However, in many complex algorithms, there may exist different types of configuration hyperparameters, and such heterogeneity may bring difficulties for classic DAC which uses a single-agent RL policy. In this paper, we aim to address this issue and propose multi-agent DAC (MA-DAC), with one agent working for one type of configuration hyperparameter. MA-DAC formulates the dynamic configuration of a complex algorithm with multiple types of hyperparameters as a contextual multi-agent Markov decision process and solves it by a cooperative multi-agent RL (MARL) algorithm. To instantiate, we apply MA-DAC to a well-known optimization algorithm for multi-objective optimization problems. Experimental results show the effectiveness of MA-DAC in not only achieving superior performance compared with other configuration tuning approaches based on heuristic rules, multi-armed bandits, and single-agent RL, but also being capable of generalizing to different problem classes. Furthermore, we release the environments in this paper as a benchmark for testing MARL algorithms, with the hope of facilitating the application of MARL.
研究动机与目标
- 为解决单智能体动态算法配置(DAC)在复杂算法中动态调整多个异构超参数时面临的挑战。
- 将联合超参数调优问题建模为协作式上下文感知多智能体马尔可夫决策过程(MMDP)。
- 开发一种可扩展、可泛化的动态算法配置解决方案,支持多种超参数类型。
- 在真实世界多目标优化算法(MOEA/D)上验证所提方法的有效性与泛化能力。
- 发布基于 MOEA/D 配置的新型多智能体强化学习(MARL)基准环境。
提出的方法
- 将具有多种超参数类型的算法动态配置建模为上下文感知多智能体马尔可夫决策过程(MMDP),其中每个智能体控制一种超参数类型。
- 采用协作式 MARL 算法——具体为值分解网络(VDN)——学习最大化共享团队奖励的联合策略。
- 基于算法运行进度和性能历史(如目标值变化)定义状态表示。
- 为每个智能体设计动作空间,对应于特定超参数的离散或连续配置(如权重、邻域大小、算子类型)。
- 通过深度强化学习端到端训练多智能体策略,采用稀疏奖励或塑形奖励,依据算法性能进行调整。
- 在 MOEA/D 上实例化该框架,对四种不同的超参数类型进行调优:权重向量、邻域大小、重组算子类型及算子特定参数。
实验结果
研究问题
- RQ1多智能体强化学习方法能否有效且协作地调优复杂算法中的多个异构超参数类型?
- RQ2MA-DAC 在多目标优化的不同问题实例和目标数量下是否具备泛化能力?
- RQ3与启发式规则、多臂赌博机和单智能体强化学习基线相比,MA-DAC 的性能表现如何?
- RQ4每种独立的超参数类型对整体算法性能的贡献是什么?
- RQ5所提框架能否作为评估 MARL 算法的可重用基准?
主要发现
- 在多目标优化问题上,MA-DAC 显著优于基于启发式规则的方法、多臂赌博机以及单智能体强化学习基线,在收敛速度和最终解质量方面表现更优。
- 所学习的 MA-DAC 策略在内类(相同目标数量但不同实例)和外类(不同目标数量)之间均表现出有效的泛化能力,展现出强大的迁移性能。
- 消融实验表明,同时调优全部四种超参数类型(权重、邻域大小、算子类型及算子参数)对实现最优性能至关重要。
- 与静态配置和单智能体动态配置方法相比,该方法在收敛性和超体积提升方面表现更优。
- 作者将 MOEA/D 配置环境作为 MARL 基准发布,支持协作式多智能体学习研究。
- 该框架成功处理了超参数类型的异质性以及进化搜索的随机性,适用于现实世界中的算法配置任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。