[论文解读] Learning-Based UAV Trajectory Optimization with Collision Avoidance and Connectivity Constraints
本文提出了一种用于多架无人飞行器(UAV)轨迹优化的去中心化深度强化学习框架,可确保防撞并维持与地面基站(GBS)的无线连接。通过整合用于估计到达时间的值网络以及利用实时SINR测量值的SINR预测神经网络,该方法可在具有动态连接性和障碍物约束的多样化环境中实现实时、高成功率导航。
Unmanned aerial vehicles (UAVs) are expected to be an integral part of wireless networks, and determining collision-free trajectories for multiple UAVs while satisfying requirements of connectivity with ground base stations (GBSs) is a challenging task. In this paper, we first reformulate the multi-UAV trajectory optimization problem with collision avoidance and wireless connectivity constraints as a sequential decision making problem in the discrete time domain. We, then, propose a decentralized deep reinforcement learning approach to solve the problem. More specifically, a value network is developed to encode the expected time to destination given the agent's joint state (including the agent's information, the nearby agents' observable information, and the locations of the nearby GBSs). A signal-to-interference-plus-noise ratio (SINR)-prediction neural network is also designed, using accumulated SINR measurements obtained when interacting with the cellular network, to map the GBSs' locations into the SINR levels in order to predict the UAV's SINR. Numerical results show that with the value network and SINR-prediction network, real-time navigation for multi-UAVs can be efficiently performed in various environments with high success rate.
研究动机与目标
- 解决在共享空域中协调多架UAV以避免碰撞并维持与地面基站(GBS)可靠连接的挑战。
- 将多UAV轨迹优化建模为离散时间下的序列决策问题,以实现实时控制。
- 设计一种去中心化学习框架,使UAV能够基于局部观测行动,而无需全局状态信息。
- 在不同环境条件下(包括不同UAV高度、GBS天线图 pattern 和障碍物/禁飞区)实现稳健性能。
- 在现实无线连接约束下,实现高导航成功率,同时最小化碰撞、断连和任务完成时间。
提出的方法
- 将多UAV轨迹问题重新表述为离散时间下的序列决策任务,以实现时间规划和动作选择。
- 开发一个值网络,基于智能体的联合状态(包括自身状态、附近其他智能体的位置以及GBS位置)估计预期到达时间。
- 设计一个SINR预测神经网络,通过在与蜂窝网络交互期间累积的SINR测量值,将GBS位置映射到预测的SINR水平。
- 使用深度强化学习算法训练智能体,其中奖励函数平衡任务完成时间、连接维持和碰撞避免。
- 通过利用学习到的SINR预测和基于值的动作选择,即使在GBS部署与训练设置不同的情况下,也能实现对未见环境的良好泛化。
- 通过将障碍物建模为联合状态观测中的静态智能体,支持在障碍物密集或禁飞区环境中的导航,使策略能够动态适应。
实验结果
研究问题
- RQ1去中心化的深度强化学习方法能否有效优化多UAV轨迹,同时确保防撞并维持与GBS的持续无线连接?
- RQ2所提出方法在GBS部署、UAV高度和天线辐射图 pattern 与训练期间不同的环境中,泛化能力如何?
- RQ3SINR预测网络在多大程度上能通过准确估计GBS位置的信号质量来提升连接感知导航?
- RQ4在涉及障碍物或禁飞区的复杂场景中,系统表现如何?随着UAV数量增加,其能否保持高成功率?
- RQ5随着UAV数量增加,任务完成时间、碰撞率、断连率和可扩展性之间存在何种权衡?
主要发现
- 所提出的RLTCW-SP算法在2架UAV场景中实现了93.02%的成功率(SR),碰撞率(CR)为4%,断连率(DR)为0.06%。
- 在5架UAV导航中,成功率保持在91.12%,由于智能体密度增加和可观测性降低,碰撞率略有上升至6.32%。
- 在8架UAV场景中,成功率降至90.075%,平均任务时间增加至1.28秒,反映出更多交互带来的复杂性增加。
- SINR预测网络实现了准确的连接性估计,使UAV能够根据GBS位置和天线图 pattern 动态调整轨迹以适应变化的覆盖区域。
- 该框架在未见环境中的泛化能力良好:UAV在不同UAV高度(50m vs. 100m)、波束宽度(15° vs. 35°)和下倾角(10° vs. 15°)下均能成功导航,同时保持高连接性和低碰撞率。
- 通过将障碍物和禁飞区建模为联合状态中的静态智能体,系统能有效处理这些情况,使策略能够避开它们,同时维持连接性和最小化路径长度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。