[论文解读] Deep Reinforcement Learning for Resource Allocation in V2V Communications
本文提出了一种用于车辆间(V2V)通信中资源分配的去中心化深度强化学习(DRL)框架,其中每个V2V链路作为独立智能体,学习最优子带和功率分配。该方法在无需完整信道状态信息的情况下,实现了优于随机和基于分组方法的干扰抑制性能,同时满足了更高的时延约束要求,且由于去中心化设计,传输开销极低。
In this article, we develop a decentralized resource allocation mechanism for vehicle-to-vehicle (V2V) communication systems based on deep reinforcement learning. Each V2V link is considered as an agent, making its own decisions to find optimal sub-band and power level for transmission. Since the proposed method is decentralized, the global information is not required for each agent to make its decisions, hence the transmission overhead is small. From the simulation results, each agent can learn how to satisfy the V2V constraints while minimizing the interference to vehicle-to-infrastructure (V2I) communications.
研究动机与目标
- 解决动态、高移动性V2V信道条件导致传统依赖信道状态信息(CSI)的集中式资源分配方法不可行的问题。
- 克服集中式方案在大规模车载网络中带来的高传输开销和可扩展性问题。
- 直接将严格的V2V时延约束整合到资源分配过程中,弥补先前研究的空白。
- 开发一种可扩展的去中心化解决方案,使每个V2V链路能够基于部分本地观测,自主优化子带和功率选择。
- 在确保V2V传输可靠性满足严格QoS要求的前提下,最小化对V2I链路的干扰。
提出的方法
- 每个V2V链路被建模为一个独立智能体,使用深度Q网络(DQN)基于本地观测学习最优动作(子带和功率等级)。
- 智能体采用多智能体DRL框架,结合经验回放和目标网络,以稳定训练并提升收敛性。
- 环境通过基于3GPP TR 36.885的城区场景进行仿真,包含9个街区、视 Line-of-Sight(LOS)/非视 Line-of-Sight(NLOS)传播,以及泊松分布的车辆。
- 奖励函数结合了V2V链路容量与违反100 ms时延约束的惩罚,以激励满足QoS要求。
- 采用ε-贪婪探索策略在训练期间平衡探索与利用,使用Adam优化算法进行策略更新。
- 系统无需全局网络状态信息,从而降低通信开销并提升可扩展性。
实验结果
研究问题
- RQ1去中心化的深度强化学习方法是否能在缺乏完整信道状态信息的情况下,有效管理高移动性V2V网络中的资源分配?
- RQ2与随机和基于分组的资源分配方法相比,所提出的基于DRL的方法在抑制对V2I链路干扰方面表现如何?
- RQ3DRL智能体在最小化干扰的同时,能在多大程度上学习满足严格的V2V时延约束(100 ms)?
- RQ4与集中式方案相比,所提出方法的去中心化特性是否显著降低了传输开销?
- RQ5DRL框架能否动态适应子带和功率分配,以在快速变化的信道条件下维持V2V传输的可靠性?
主要发现
- 所提出的DRL方法在V2I链路容量方面显著优于随机分配和文献[8]中的基于分组的方法,尤其在V2V链路数量增加时表现更优。
- 在100 ms时延约束下,DRL方法的成功V2V传输概率远高于基线方法,表明其具备有效的时延感知资源管理能力。
- 与文献[8]的方法相比,基于DRL的系统对V2I链路的干扰抑制效果更优,后者仅优化V2V的SINR而未考虑V2I性能。
- 去中心化设计显著降低了传输开销,因为智能体仅依赖本地观测和邻居间信息交换,无需收集全局信息。
- DRL智能体成功学习到动态共享频谱并调整功率,有效减少冲突,提升V2V链路间的公平性。
- 仿真结果表明,DRL框架通过端到端学习,能够有效平衡多个相互竞争的目标——最大化V2V吞吐量、最小化V2I干扰,同时满足时延约束。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。