[论文解读] Cooperative Internet of UAVs: Distributed Trajectory Design by Multi-agent Deep Reinforcement Learning
本文提出了一种基于多智能体深度强化学习的分布式轨迹设计框架,用于蜂窝物联网中的协作无人机(UAVs)。通过引入一种复合动作演员-critic(CA2C)算法,联合优化离散任务选择与连续位置选择,该方法显著降低了信息年龄(AoI)——优于四种基线方法,并使协作无人机相比非协作方案更有效地减少AoI。
Due to the advantages of flexible deployment and extensive coverage, unmanned aerial vehicles (UAVs) have great potential for sensing applications in the next generation of cellular networks, which will give rise to a cellular Internet of UAVs. In this paper, we consider a cellular Internet of UAVs, where the UAVs execute sensing tasks through cooperative sensing and transmission to minimize the age of information (AoI). However, the cooperative sensing and transmission is tightly coupled with the UAVs' trajectories, which makes the trajectory design challenging. To tackle this challenge, we propose a distributed sense-and-send protocol, where the UAVs determine the trajectories by selecting from a discrete set of tasks and a continuous set of locations for sensing and transmission. Based on this protocol, we formulate the trajectory design problem for AoI minimization and propose a compound-action actor-critic (CA2C) algorithm to solve it based on deep reinforcement learning. The CA2C algorithm can learn the optimal policies for actions involving both continuous and discrete variables and is suited for the trajectory design. {Our simulation results show that the CA2C algorithm outperforms four baseline algorithms}. Also, we show that by dividing the tasks, cooperative UAVs can achieve a lower AoI compared to non-cooperative UAVs.
研究动机与目标
- 为解决在多个无人机执行协作感知与传输的蜂窝物联网中最小化信息年龄(AoI)的挑战。
- 设计一种分布式轨迹规划协议,使无人机能够在无集中协调的情况下联合优化感知位置与传输调度。
- 开发一种基于强化学习的解决方案,能够处理混合离散-连续动作空间,以实现高效轨迹策略学习。
- 评估协作无人机在AoI最小化与系统效率方面相较于非协作方案的性能增益。
- 研究在三维无人机轨迹设计设置下,飞行高度与子载波分配对AoI性能的影响。
提出的方法
- 提出一种分布式感知与发送协议,无人机从离散任务集和连续空间位置中选择用于感知与传输的选项。
- 将轨迹设计问题建模为马尔可夫决策过程(MDP),目标是最小化所有任务的归一化累积AoI。
- 引入一种复合动作演员-critic(CA2C)算法,结合深度Q网络(DQN)与深度确定性策略梯度(DDPG),以处理联合离散-连续动作空间。
- 采用集中式评论家与去中心化演员的结构,实现在保持可扩展性与分布式学习的同时实现多智能体协调。
- 使用经验回放与目标网络以稳定训练过程,动作输出包括任务索引与三维位置坐标。
- 通过允许无人机在[100, 200]米的定义范围内选择感知高度,将该框架扩展至三维轨迹设计。
实验结果
研究问题
- RQ1如何协调协作无人机以最小化蜂窝物联网中累积的信息年龄(AoI)?
- RQ2在AoI减少方面,协作感知与传输相比非协作无人机部署的性能增益如何?
- RQ3在AoI最小化方面,最优飞行高度如何随可用子载波数量变化?
- RQ4深度强化学习算法能否有效处理多智能体无人机轨迹设计中的混合离散-连续动作空间?
- RQ5所提出的CA2C算法与传统轨迹规划方法(如最短路径与贪婪算法)在AoI性能方面相比如何?
主要发现
- 所提出的CA2C算法在最小化归一化累积AoI方面优于四种基线算法——贪婪法、最短路径法、非协作多智能体DRL与集中式DRL。
- 协作无人机实现的归一化累积AoI低于非协作无人机,且随着无人机数量增加,AoI减少程度也相应提升。
- 当可用子载波为80个时,最小化AoI的最优飞行高度为150米,且该最优高度随子载波数量增加而上升。
- 在K=80个子载波条件下,使用CA2C算法的无人机平均选择的感知高度为161米,接近模拟中确定的最优150米。
- 随着子载波数量增加,归一化累积AoI下降,原因是传输时延缩短。
- 传统算法如最短路径法与贪婪法导致无人机轨迹重叠,且由于未能有效利用环境状态信息,造成AoI更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。