[论文解读] UAV-to-Device Underlay Communications: Age of Information Minimization by Multi-agent Deep Reinforcement Learning
该论文提出了一种多智能体深度强化学习(DRL)框架,用于在蜂窝式无人机互联网中的无人机到设备(U2D)共享通信中最小化信息年龄(AoI)。通过将无人机轨迹设计建模为具有连续状态-动作空间的马尔可夫决策过程,作者采用基于深度确定性策略梯度(DDPG)的多智能体DRL算法,联合优化无人机在感知与传输中的轨迹,仿真结果表明其AoI低于贪婪策略和策略梯度基线方法。
In recent years, unmanned aerial vehicles (UAVs) have found numerous sensing applications, which are expected to add billions of dollars to the world economy in the next decade. To further improve the Quality-of-Service (QoS) in such applications, the 3rd Generation Partnership Project (3GPP) has considered the adoption of terrestrial cellular networks to support UAV sensing services, also known as the cellular Internet of UAVs. In this paper, we consider a cellular Internet of UAVs, where the sensory data can be transmitted either to base station (BS) via cellular links, or to mobile devices by underlay UAV-to-Device (U2D) communications. To evaluate the freshness of data, the age of information (AoI) is adopted, in which a lower AoI implies fresher data. Since UAVs' AoIs are determined by their trajectories during sensing and transmission, we investigate the AoI minimization problem for UAVs by designing their trajectories. This problem is a Markov decision problem (MDP) with an infinite state-action space, and thus we utilize multi-agent deep reinforcement learning (DRL) to approximate the state-action space. Then, we propose a multi-UAV trajectory design algorithm to solve this problem. Simulation results show that our algorithm achieves a lower AoI than greedy algorithm and policy gradient algorithm.
研究动机与目标
- 为解决在蜂窝式无人机互联网中的无人机到设备(U2D)共享通信中最小化信息年龄(AoI)的挑战。
- 联合优化无人机在感知与传输中的轨迹,因为AoI同时依赖于移动性和传输动态特性。
- 处理多无人机系统中无限状态-动作空间以及不可观测的干扰问题,这使得传统基于模型的方法变得复杂。
- 设计一种联合感知与传输协议,以实现马尔可夫状态转移,从而将AoI最小化问题建模为马尔可夫决策过程(MDP)。
- 开发一种可扩展的、分布式的轨迹设计算法,利用多智能体深度强化学习(DRL)实现实时适应动态无人机网络。
提出的方法
- 由于无人机移动性和传输功率控制,将AoI最小化问题建模为具有连续状态和动作空间的马尔可夫决策过程(MDP)。
- 将无人机感知与传输建模为马尔可夫链中的状态转移,以捕捉AoI演化中的时间依赖性。
- 应用多智能体深度强化学习(DRL),采用深度确定性策略梯度(DDPG)算法,为每个无人机学习去中心化的策略。
- 使用集中式评论家网络估计价值函数,同时每个无人机基于其本地观测进行行动,从而在多智能体环境中实现信用分配。
- 实施一种联合感知与传输协议,协调无人机操作,并通过及时更新确保数据新鲜度。
- 采用一种奖励函数,对高AoI进行惩罚,并鼓励频繁且可靠的数据更新,以引导策略学习。
实验结果
研究问题
- RQ1如何联合优化多无人机蜂窝网络中无人机的感知与传输轨迹,以最小化信息年龄(AoI)?
- RQ2当其他无人机的干扰不可观测且动态变化时,共享U2D通信对AoI有何影响?
- RQ3多智能体深度强化学习能否有效处理无人机轨迹设计中AoI最小化问题的无限状态-动作空间和部分可观测性?
- RQ4所提出的基于DRL的轨迹设计方法在AoI性能方面与贪婪策略和策略梯度基线相比如何?
- RQ5AoI与系统参数(如数据需求和子信道可用性)之间存在何种关系?
主要发现
- 所提出的多智能体DRL算法在所有测试场景中均实现了比贪婪算法和策略梯度基线更低的平均AoI。
- 无人机AoI随感知数据需求的增加呈线性增长,表明数据量与数据新鲜度之间存在直接权衡。
- AoI随可用子信道数量的增加而减少,但最终因干扰限制和资源约束而趋于饱和。
- 该算法有效平衡了无人机移动性与传输调度,通过协同轨迹规划减少了数据陈旧性。
- 仿真结果证实,基于DRL的方法能良好适应动态环境,在最小化数据年龄方面优于启发式方法。
- 该方法成功处理了连续、高维的状态-动作空间以及部分可观测性,在多无人机系统中表现出良好的可扩展性与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。