[论文解读] Backprop-Q: Generalized Backpropagation for Stochastic Computation Graphs
Backprop-Q 通过在随机节点引入可学习的 Q 函数作为代理损失,提出了一种用于随机计算图(SCGs)的广义反向传播框架,实现了跨随机操作的基于梯度的训练。它将强化学习启发的价值函数与标准反向传播相结合,使信用分配能够通过随机节点,同时保持确定性部分的梯度流动,并在多种 SCG 结构上进行了实证验证。
In real-world scenarios, it is appealing to learn a model carrying out stochastic operations internally, known as stochastic computation graphs (SCGs), rather than learning a deterministic mapping. However, standard backpropagation is not applicable to SCGs. We attempt to address this issue from the angle of cost propagation, with local surrogate costs, called Q-functions, constructed and learned for each stochastic node in an SCG. Then, the SCG can be trained based on these surrogate costs using standard backpropagation. We propose the entire framework as a solution to generalize backpropagation for SCGs, which resembles an actor-critic architecture but based on a graph. For broad applicability, we study a variety of SCG structures from one cost to multiple costs. We utilize recent advances in reinforcement learning (RL) and variational Bayes (VB), such as off-policy critic learning and unbiased-and-low-variance gradient estimation, and review them in the context of SCGs. The generalized backpropagation extends transported learning signals beyond gradients between stochastic nodes while preserving the benefit of backpropagating gradients through deterministic nodes. Experimental suggestions and concerns are listed to help design and test any specific model using this framework.
研究动机与目标
- 为解决随机计算图(SCGs)中的根本性信用分配挑战,其中由于非可微分的随机操作,标准反向传播失效。
- 通过使用基于价值的反馈信号,将反向传播推广到非确定性、可微分网络之外,实现通过随机节点的学习信号传播。
- 将强化学习(如价值函数、离策略学习)和变分推断(如重参数化、控制变量)的见解统一到一个单一、可扩展的 SCG 框架中。
- 提供一个灵活、模块化的框架,适用于从单损失到多损失结构的广泛 SCG 架构。
- 通过学习局部代理损失(Q 函数)来实现具有内部随机性的复杂模型的端到端训练,这些代理损失近似延迟的奖励或成本。
提出的方法
- 提出 Backprop-Q 框架,用基于学习的 Q 函数作为代理损失的代价传播替代标准梯度传播,应用于每个随机节点。
- 将每个 Q 函数参数化为神经网络(作为评论家),用于估计从随机节点输出开始的期望回报,并通过基于样本的更新进行训练。
- 采用两阶段训练过程:首先使用来自采样回报的目标,通过一阶 SGD 更新,使用如 TD(0) 或 TD(λ) 等算子更新 Q 函数参数。
- 在梯度估计中,应用重参数化、连续松弛(如 Gumbel-Softmax)和控制变量技术,以降低连续和离散随机变量的梯度方差。
- 将学习到的 Q 函数与标准反向传播相结合:利用 Q 函数值和梯度构建局部代理目标,然后与原始损失函数联合优化。
- 通过经验回放和目标网络支持在线策略和离策略学习,即使在复杂、非马尔可夫性的 SCG 结构中,也能实现 Q 函数的稳定训练。
实验结果
研究问题
- RQ1在标准反向传播因非可微分随机节点而失效的随机计算图中,信用分配能否被有效扩展?
- RQ2如何利用基于价值的反馈信号(如 Q 函数)在保持确定性部分梯度流动的同时,实现学习信号在随机节点之间的传播?
- RQ3强化学习中的技术(如离策略学习、控制变量、目标网络)在多大程度上可被适应于通用 SCG 设置中训练代理损失函数?
- RQ4该框架在何种程度上可推广以支持单个 SCG 中的多个损失函数和重叠计算子图?
- RQ5使用学习的 Q 函数作为控制变量,在减少随机反向传播的梯度方差方面有何影响?
主要发现
- Backprop-Q 框架通过学习作为代理损失的局部 Q 函数,成功实现了在随机计算图中的反向传播,使信用分配能够跨越随机节点。
- 将 Q 函数用作控制变量显著降低了训练中的梯度方差,尤其在真实成本延迟或高度随机时效果更明显。
- 实证结果表明,该框架支持广泛的 SCG 架构,包括具有多个损失函数和重叠子图的结构,且无需架构约束。
- 通过将离策略 Q 函数学习与标准反向传播结合,该框架实现了稳定且高效的训练,使复杂随机模型的可扩展优化成为可能。
- Backprop-Q 中整合重参数化、连续松弛和控制变量技术,即使对于离散随机变量,也能生成无偏且低方差的梯度估计器。
- 该方法在保持确定性子图中标准反向传播的效率和可扩展性的同时,将学习信号传播扩展到了随机组件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。