Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning of Graph Neural Networks for Service Function Chaining

DongNyeong Heo, Do‐Young Lee|arXiv (Cornell University)|Nov 17, 2020
Software-Defined Networks and 5G参考文献 10被引用 4
一句话总结

本文提出了一种强化学习(RL)框架,用于在动态网络拓扑中训练图神经网络(GNNs)以实现服务功能链(SFC),无需标注数据即可实现泛化。通过基于路径有效性与延迟的稀疏奖励,RL训练的GNN在固定拓扑上的性能与监督学习相当,但在未见过的、随机生成的拓扑上显著优于监督学习方法,展现出更强的鲁棒性与适应性。

ABSTRACT

In the management of computer network systems, the service function chaining (SFC) modules play an important role by generating efficient paths for network traffic through physical servers with virtualized network functions (VNF). To provide the highest quality of services, the SFC module should generate a valid path quickly even in various network topology situations including dynamic VNF resources, various requests, and changes of topologies. The previous supervised learning method demonstrated that the network features can be represented by graph neural networks (GNNs) for the SFC task. However, the performance was limited to only the fixed topology with labeled data. In this paper, we apply reinforcement learning methods for training models on various network topologies with unlabeled data. In the experiments, compared to the previous supervised learning method, the proposed methods demonstrated remarkable flexibility in new topologies without re-designing and re-training, while preserving a similar level of performance.

研究动机与目标

  • 解决监督学习在SFC中的局限性,即需要标注数据且在新拓扑上表现不佳。
  • 开发一种灵活的SFC模块,可在无需重新训练的情况下泛化至多样化、动态的网络拓扑。
  • 通过仅依赖环境提供的奖励,实现基于GNN的SFC模型的端到端训练,消除对标注路径的依赖。
  • 提升SFC路径生成在虚拟网络功能(VNF)位置与网络结构变化下的鲁棒性。

提出的方法

  • 使用REINFORCE算法训练基于GNN的SFC模型,采用自定义奖励函数,结合路径有效性和延迟惩罚。
  • 设计稀疏奖励信号:成功生成路径得+1分,失败得-1分,并根据超参数λ对延迟施加惩罚。
  • 在训练期间引入两种拓扑增强策略:随机添加/移除节点/边,以及随机重新定位VNF,以模拟多样化的网络状态。
  • 采用与先前工作相同的GG-RNN架构,但通过强化学习而非监督学习进行微调。
  • 在训练期间应用ε-greedy探索策略,ε = 0.01,以平衡探索与利用。
  • 在每轮训练中使用100个随机生成的拓扑,确保模型充分接触结构多样性。

实验结果

研究问题

  • RQ1强化学习能否在不依赖昂贵ILP求解器提供的标注路径的情况下,训练GNN用于SFC?
  • RQ2与监督学习相比,基于强化学习的训练在未见网络拓扑上的泛化能力如何?
  • RQ3在奖励函数中引入延迟惩罚是否能提升强化学习训练模型的路径质量?
  • RQ4训练期间采用的不同拓扑增强策略如何影响模型对结构变化的鲁棒性?
  • RQ5强化学习训练的SFC模型能否在新拓扑上保持高性能,同时不降低在原始拓扑上的表现?

主要发现

  • 在原始的'internet2'拓扑上,RL方法的失败率为0.00%,延迟比为1.01,与监督基线方法性能相当。
  • 在随机改变的拓扑(CS1)上,RL模型将失败率降低至0.00%,而监督方法为1.00%,展现出更优的泛化能力。
  • 在同时存在结构变化与VNF重新定位的拓扑(CS2)上,RL模型维持0.00%的失败率,而监督方法在1.00%的情况下失败。
  • 采用λ = 1(延迟惩罚)训练的模型获得1.01的延迟比,略差于λ = 0(1.00),但在动态环境中的路径质量显著提升。
  • 在第三项测试中,采用CS2策略训练的RL模型比CS1更具鲁棒性,表明训练期间更丰富的拓扑变化可增强模型的适应能力。
  • 劣化率指标证实,与监督模型相比,RL模型对拓扑变化的敏感度显著更低,验证了其更强的灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。