Skip to main content
QUICK REVIEW

[论文解读] Representation Learning on Graphs: A Reinforcement Learning Application

Sephora Madjiheurem, Laura Toni|arXiv (Cornell University)|Jan 16, 2019
Reinforcement Learning in Robotics参考文献 15被引用 5
一句话总结

本文提出了一种广义的表示策略迭代(RPI)框架,用学习到的图表示模型——具体为node2vec和变分图自编码器(Variational Graph Autoencoders)——替代传统的原型值函数(PVFs),用于强化学习中的线性值函数近似。结果表明,这些学习到的特征能够捕捉结构几何与局部图特性,在低维状态空间中显著优于PVFs,其中node2vec通过强调结构等价性而取得更优性能。

ABSTRACT

In this work, we study value function approximation in reinforcement learning (RL) problems with high dimensional state or action spaces via a generalized version of representation policy iteration (RPI). We consider the limitations of proto-value functions (PVFs) at accurately approximating the value function in low dimensions and we highlight the importance of features learning for an improved low-dimensional value function approximation. Then, we adopt different representation learning algorithm on graphs to learn the basis functions that best represent the value function. We empirically show that node2vec, an algorithm for scalable feature learning in networks, and the Variational Graph Auto-Encoder constantly outperform the commonly used smooth proto-value functions in low-dimensional feature space.

研究动机与目标

  • 解决当底层状态空间几何结构不规则或建模不佳时,传统原型值函数(PVFs)在值函数近似方面的局限性。
  • 探究在图上进行表征学习是否能为强化学习中的线性值函数近似提供更优的基函数。
  • 评估现代图嵌入方法——node2vec与变分图自编码器(Variational Graph Autoencoders)——在低维特征空间中相对于标准PVFs的性能表现。
  • 确定哪些图表示学习策略最能保持MDP诱导图的几何结构,从而提升值函数近似性能。

提出的方法

  • 将表示策略迭代(RPI)算法广义化,以支持任意基函数,替代原始RPI中固定的拉普拉斯特征映射。
  • 从收集的MDP轨迹构建状态转移图,其中节点代表状态,边代表转移概率。
  • 应用node2vec学习低维节点嵌入,以保留图的局部与全局结构,利用超参数p和q控制随机游走策略。
  • 训练变分图自编码器(VGAE),通过从潜在空间嵌入重建邻接矩阵来学习节点表示。
  • 将学习到的嵌入用作线性值函数近似中的基函数,通过最小二乘优化最小化预测值函数与真实值函数之间的均方误差。
  • 使用网格搜索优化node2vec的超参数(p和q),以识别在值函数近似中表现最佳的采样策略。

实验结果

研究问题

  • RQ1与传统的原型值函数相比,图上的表征学习是否能提升强化学习中的值函数近似性能?
  • RQ2在低维特征空间中,不同图表示学习方法——特别是node2vec与变分图自编码器——在值函数近似中的表现如何?
  • RQ3节点嵌入的哪些特性(例如,结构等价性与同质性)对有效的值函数近似最为关键?
  • RQ4所学基函数的性能是否依赖于随机游走过程中采用的采样策略,特别是广度优先与深度优先探索之间?

主要发现

  • 当p=1且q=4时,node2vec通过强调结构等价性,优于所有其他参数设置,并显著提升了值函数近似的准确性。
  • 使用node2vec嵌入能更有效地降低值函数近似的均方误差,尤其在低维特征空间中表现优于原型值函数。
  • 尽管训练成本更高,变分图自编码器(VGAE)相较于node2vec仅获得微小的性能提升,表明在此情境下更简单的模型可能已足够有效。
  • 当嵌入方法能同时保持MDP诱导图的全局结构几何与局部邻域特性时,学习特征带来的性能增益最为显著。
  • 当图估计不佳时,PVFs所依赖的平滑性假设在实践中并不成立,这为基于数据的基函数学习提供了合理性。
  • 结果表明,优先考虑结构等价性而非同质性的表征学习模型,更适合于强化学习中的值函数近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。