[论文解读] Evaluating the Performance of Reinforcement Learning Algorithms
本文提出了一种原则性且全面的强化学习(RL)算法评估方法,通过引入性能百分位数、基于博弈论的聚合度量方法以及性能边界传播(PBP),解决了性能报告中的一致性问题,从而量化不确定性。该方法实现了跨环境的可靠、可复现比较,表明Sarsa(λ)-Parl2与PPO在极少超参数调优下平均表现最佳。
Performance evaluations are critical for quantifying algorithmic advances in reinforcement learning. Recent reproducibility analyses have shown that reported performance results are often inconsistent and difficult to replicate. In this work, we argue that the inconsistency of performance stems from the use of flawed evaluation metrics. Taking a step towards ensuring that reported results are consistent, we propose a new comprehensive evaluation methodology for reinforcement learning algorithms that produces reliable measurements of performance both on a single environment and when aggregated across environments. We demonstrate this method by evaluating a broad class of reinforcement learning algorithms on standard benchmark tasks.
研究动机与目标
- 通过将有缺陷的评估指标识别为性能报告不一致的根本原因,解决RL中的可复现性危机。
- 开发一种科学的评估程序,量化不确定性并反映RL算法在现实世界中的可用性。
- 通过避免对特定环境或归一化方法的偏倚,确保公平性与非被利用性。
- 确保计算上的可行性,使普通研究人员无需专用资源即可复现结果。
- 回答通用评估问题:哪些算法在极少调优下能在多样化环境中表现良好?
提出的方法
- 引入性能百分位数作为归一化、相对的性能度量,通过在每个环境中对算法性能进行排名,实现跨环境比较。
- 采用基于博弈论的方法构建聚合性能度量,公平地结合不同环境中加权贡献的结果。
- 应用性能边界传播(PBP)在整个评估流程中严格量化并传播不确定性,包括置信区间。
- 将聚合性能度量定义为跨环境归一化得分的加权期望,确保鲁棒性与可解释性。
- 使用累积分布函数(CDF)和分位数函数,对由于随机种子和随机性引起的表现变异性进行建模。
- 使用函数g(x,j)对得分进行归一化,将原始回报映射到不同环境中共通的尺度,提升可比性。
实验结果
研究问题
- RQ1哪些RL算法能在多种环境中实现高性能,且仅需极少超参数调优?
- RQ2如何使RL中的性能评估更加可靠、可复现且具有科学严谨性?
- RQ3RL结果中的不确定性和变异性对算法比较与选择有何影响?
- RQ4是否可以构建一个统一的评估框架,在不偏袒特定算法的前提下,公平比较多样化环境中的算法?
- RQ5如何在整个评估过程中量化并传播性能测量中的不确定性?
主要发现
- Sarsa(λ)-Parl2与PPO在所有环境中均持续位列前茅,其中Sarsa(λ)-Parl2在Gridworld 10 Deterministic(均值:-12.2)和Pinball Single(均值:3754.6)中取得最高平均性能。
- 性能百分位数有效归一化了不同回报尺度环境中的得分,实现公平比较;例如,Sarsa-Parl2在Pinball Box上的平均表现为8823.2,95%置信区间为(8513.4,8998.4)。
- 性能边界传播(PBP)成功量化了不确定性,置信区间提供了稳健的边界——例如,PPO在Pinball Box上的表现为5184.6 ± 262.8(95%置信区间)。
- 像NAC-TD这样的算法持续表现欠佳,所有环境中均表现最差(例如,在Pinball Single中均值为-1229.4),凸显了该评估框架在揭示此类结果方面的价值。
- 该方法揭示,平均性能更高的算法并不总是更稳健:例如,Q(λ)与Q(λ)-s表现出高方差(例如,在Gridworld 10 Stochastic中95%置信区间为(-379.2,-326.9)),表明其不稳定性。
- 该评估框架实现了公平、非被利用的比较:无算法因归一化或环境加权而获益,且结果对普通研究人员而言计算上可行,可复现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。