Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning in Multi-Agent Reinforcement Learning with Double Q-Networks for Distributed Resource Sharing in V2X Communication

Hammad Zafar, Zoran Utkovski|arXiv (Cornell University)|Jul 13, 2021
Transportation and Mobility Innovations参考文献 10被引用 4
一句话总结

本文提出了一种增强型迁移学习的双DQN框架(DDQN-TQL),用于车联网(V2X)网络中的分布式频谱共享,结合双Q-learning以减少价值高估,并利用迁移学习加速训练。在有限训练时间内,该方法将V2V分组交付率最高提升12%,V2I总容量提升6%,中位数交付延迟从35ms降低至18ms。

ABSTRACT

This paper addresses the problem of decentralized spectrum sharing in vehicle-to-everything (V2X) communication networks. The aim is to provide resource-efficient coexistence of vehicle-to-infrastructure(V2I) and vehicle-to-vehicle(V2V) links. A recent work on the topic proposes a multi-agent reinforcement learning (MARL) approach based on deep Q-learning, which leverages a fingerprint-based deep Q-network (DQN) architecture. This work considers an extension of this framework by combining Double Q-learning (via Double DQN) and transfer learning. The motivation behind is that Double Q-learning can alleviate the problem of overestimation of the action values present in conventional Q-learning, while transfer learning can leverage knowledge acquired by an expert model to accelerate learning in the MARL setting. The proposed algorithm is evaluated in a realistic V2X setting, with synthetic data generated based on a geometry-based propagation model that incorporates location-specific geographical descriptors of the simulated environment(outlines of buildings, foliage, and vehicles). The advantages of the proposed approach are demonstrated via numerical simulations.

研究动机与目标

  • 解决在V2X频谱共享的多智能体深度强化学习(MARL)中Q值高估的问题。
  • 通过利用预训练专家模型的知识,减少基于MARL的分布式资源分配所需的训练时间。
  • 在具有不同信道条件和网络拓扑的动态V2X环境中提升系统性能。
  • 在真实、基于几何的GEMV²验证的V2V传播环境中评估所提方法,以确保时空一致性。

提出的方法

  • 集成双DQN(DDQN)通过将动作选择与价值估计解耦,减轻Q值高估问题。
  • 通过使用在DDQN上预训练的专家模型权重初始化学习者模型的Q网络,应用迁移学习。
  • 为专家模型与学习者模型使用相同的观测空间、动作空间与奖励空间,以确保策略迁移的一致性。
  • 将专家模型训练3,000个回合,学习者模型仅训练1,800个回合,以评估样本效率。
  • 采用GEMV²基于几何的信道模型,生成具有地理描述符的、随时间演化的现实传播条件。
  • 采用基于指纹的DQN架构,以支持V2V智能体之间的分布式实现。

实验结果

研究问题

  • RQ1双DQN能否在基于MARL的V2X频谱共享中减少Q值高估,从而提升策略质量?
  • RQ2从预训练专家模型迁移知识是否能显著缩短V2X MARL中学习者模型的训练时间?
  • RQ3在不同分组大小和信道条件下,所提DDQN-TQL方法与标准DDQN及随机基线相比性能如何?
  • RQ4在训练时间受限的情况下,迁移学习与从零开始训练相比,对V2X MARL性能的影响如何?

主要发现

  • 在1,800回合训练限制下,DDQN-TQL将中位数V2V分组交付延迟从DDQN的35ms降低至18ms。
  • 对于4×1060字节的分组大小,DDQN-TQL相比DDQN实现了V2V交付率12%的提升和V2I总容量6%的增益。
  • 当训练限制在1,800回合时,DDQN-TQL优于标准DDQN,表明其具有更高的样本效率。
  • 在更长的训练时长(如>3,000回合)下,不使用迁移学习的DDQN优于DDQN-TQL,表明迁移学习设置中可能存在过拟合现象。
  • 在高分组量场景下,所提方法展现出显著的性能提升,此时训练效率与策略质量最为关键。
  • 使用GEMV²模型可实现对MARL策略在时空维度上的一致且真实的评估,验证了所提框架的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。