[论文解读] Modularity in Reinforcement Learning via Algorithmic Independence in Credit Assignment
本文通过在学习的算法因果模型中施加信用分配的算法独立性(即模组化标准——一种d-分离条件),提出了一种强化学习中动态模组化的正式框架。结果表明,某些单步时序差分方法满足该标准,并在迁移学习中表现出更优的样本效率,尤其是在重新适应先前已解决的任务时,而策略梯度方法由于缺乏此类独立性,易受灾难性遗忘影响。
Many transfer problems require re-using previously optimal decisions for solving new tasks, which suggests the need for learning algorithms that can modify the mechanisms for choosing certain actions independently of those for choosing others. However, there is currently no formalism nor theory for how to achieve this kind of modular credit assignment. To answer this question, we define modular credit assignment as a constraint on minimizing the algorithmic mutual information among feedback signals for different decisions. We introduce what we call the modularity criterion for testing whether a learning algorithm satisfies this constraint by performing causal analysis on the algorithm itself. We generalize the recently proposed societal decision-making framework as a more granular formalism than the Markov decision process to prove that for decision sequences that do not contain cycles, certain single-step temporal difference action-value methods meet this criterion while all policy-gradient methods do not. Empirical evidence suggests that such action-value methods are more sample efficient than policy-gradient methods on transfer problems that require only sparse changes to a sequence of previously optimal decisions.
研究动机与目标
- 形式化在训练过程中机制动态演化的动态学习系统中的模组化。
- 定义在强化学习中何时可对可学习机制进行独立修改的理论。
- 开发一种实用标准,用于评估学习算法是否支持模组化信用分配。
- 解释为何某些强化学习算法在仅需对先前最优策略进行稀疏修改的任务中,能比其他算法更高效地迁移。
- 为理解信用分配模组化提供因果性与算法信息论基础。
提出的方法
- 引入学习的算法因果模型(ACML),即表示整个学习过程的因果图。
- 将动态模组化定义为在先前计算图条件下,机制之间的算法独立性。
- 提出模组化标准:ACML中的一种d-分离条件,用于测试信用分配信号的算法独立性。
- 使用社会决策框架作为MDP的细粒度替代方案,分别表示个体动作值机制。
- 将模组化标准应用于比较单步时序差分方法与策略梯度方法。
- 通过实证评估在仅需极小策略变化的任务间迁移效率,对比CVS(克隆维克里社会)与PPO。
实验结果
研究问题
- RQ1我们能否在机制于训练过程中演化的动态学习系统中,正式定义模组化?
- RQ2在强化学习中,可学习机制的独立修改在何种条件下是可能的?
- RQ3我们如何实际测试一个学习算法是否支持模组化信用分配?
- RQ4为何某些强化学习算法在迁移过程中能比其他算法更好地保持最优行为?
- RQ5与网络分解相比,梯度中的算法独立性在多大程度上促进了更灵活的适应?
主要发现
- 模组化标准成功识别出某些单步时序差分方法在信用分配中满足算法独立性,而所有策略梯度方法均不满足。
- 实证结果表明,CVS(一种单步TD方法)在从训练任务迁移至仅单个动作改变的相似迁移任务时,样本效率比PPO高出13.9倍。
- 当从新任务回迁至先前任务时,CVS的样本效率比PPO高出十倍以上,表明PPO因缺乏模组化而遭受灾难性遗忘。
- PPOF(一种分解后的PPO变体)在前向迁移中表现与PPO相似,但在反向迁移中与CVS相当,表明网络分解本身可缓解遗忘,但效果不如算法独立性。
- PPO中缺乏算法独立性,导致在训练过程中无关动作机制(如不在新最优序列中的动作)被显著修改,从而引发遗忘。
- 本研究发现,在所测试设置中,梯度中的算法独立性是迁移效率的更强预测因子,优于网络分解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。