[论文解读] Graph neural induction of value iteration
本论文提出一种图神经网络(GNN),可直接在任意马尔可夫决策过程(MDP)结构上学习执行值迭代(VI)算法,通过在中间VI状态上进行逐步监督。该GNN在不同大小、拓扑结构和稀疏度的分布外MDP上实现了强大的零样本泛化能力,表明GNN能够以高精度和策略恢复能力稳健地诱导VI算法。
Many reinforcement learning tasks can benefit from explicit planning based on an internal model of the environment. Previously, such planning components have been incorporated through a neural network that partially aligns with the computational graph of value iteration. Such network have so far been focused on restrictive environments (e.g. grid-worlds), and modelled the planning procedure only indirectly. We relax these constraints, proposing a graph neural network (GNN) that executes the value iteration (VI) algorithm, across arbitrary environment models, with direct supervision on the intermediate steps of VI. The results indicate that GNNs are able to model value iteration accurately, recovering favourable metrics and policies across a variety of out-of-distribution tests. This suggests that GNN executors with strong supervision are a viable component within deep reinforcement learning systems.
研究动机与目标
- 开发一种神经网络,通过在中间步骤上显式监督直接学习值迭代算法,而非仅依赖基于奖励的训练。
- 利用图神经网络将值迭代规划从网格世界扩展到具有可变状态和动作空间的任意MDP。
- 探究GNN是否能够以高保真度学习值迭代的算法结构,并泛化到未见过的MDP拓扑结构。
- 通过结合MDP模型推理与可微分值迭代执行,实现规划与策略学习的集成。
提出的方法
- 该方法采用消息传递GNN(MPNN)架构,通过图卷积操作直接模拟值迭代更新规则。
- 图中每个节点(状态)维护一个值估计,通过基于转移概率和奖励的邻居消息聚合进行更新。
- 消息函数计算每个动作和后继状态的贡献,使用可学习的MLP建模折扣因子γ与转移概率p(s′|s,a)的乘积。
- 更新规则通过GNN层实现,应用贝尔曼更新:v^(t+1)(s) = max_a [r(s,a) + γ Σ p(s′|s,a) v^(t)(s′)]。
- GNN通过在每个VI迭代的中间值估计上使用均方误差(MSE)损失进行直接监督训练。
- 模型在多种MDP上进行评估,包括Erdős-Rényi、无标度和稀疏图,实现了对未见图分布的零样本泛化,以及对确定性迷宫的测试。
实验结果
研究问题
- RQ1能否通过在中间步骤上的监督,而非仅在最终回报上,训练GNN直接模拟值迭代算法?
- RQ2该GNN在训练时未见过的状态数和动作数不同的MDP上泛化能力如何?
- RQ3在具有不同底层图结构(如无标度、星型、树状)的MDP上测试时,GNN是否保持高策略准确率?
- RQ4在更稀疏或更确定性的MDP(如标准8×8迷宫)上,性能如何退化?
- RQ5能否将GNN与从轨迹中学习MDP模型相结合,形成一种端到端可微分的、无需环境模型的规划系统?
主要发现
- MPNN-Sum模型在100个状态和20个动作的MDP上实现了99.3%的策略准确率,即使在分布外测试中也表现优异。
- 该模型对未见的MDP图分布(包括无标度(Barabási-Albert)、星型和树状结构)具有稳健的泛化能力,策略准确率始终高于90%。
- 在完全确定性的8×8迷宫上,策略准确率下降至70%,表明在训练数据中未充分表示的稀疏、确定性图上性能有所退化。
- 使用注意力机制的消息聚合(Attn-Sum)虽降低了MSE,但显著损害了策略准确率,表明注意力机制在保持VI中值排序方面不甚合适。
- 两层消息函数(MPNN-2-Sum)的性能与单层模型相当,表明简单MLP已足够建模VI更新。
- GNN在不同迭代中实现了低MSE(例如|S|=100, |A|=20时为5.123),并表现出平稳收敛,显示出对VI动态的稳定学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。