[论文解读] RL-Based User Association and Resource Allocation for Multi-UAV enabled MEC
该论文提出了一种基于强化学习的用户关联与资源分配(RLAA)算法,用于多无人机(UAV)支持的移动边缘计算(MEC)系统,以最小化总能耗。通过将联合用户关联与资源分配建模为混合整数非线性规划(MINLP)问题,RLAA利用深度Q网络(DQN)学习最优卸载决策与资源分配,在小规模场景中实现近似最优性能,并在大规模部署中显著降低能耗。
In this paper, multi-unmanned aerial vehicle (UAV) enabled mobile edge computing (MEC), i.e., UAVE is studied, where several UAVs are deployed as flying MEC platform to provide computing resource to ground user equipments (UEs). Compared to the traditional fixed location MEC, UAV enabled MEC (i.e., UAVE) is particular useful in case of temporary events, emergency situations and on-demand services, due to its high flexibility, low cost and easy deployment features. However, operation of UAVE faces several challenges, two of which are how to achieve both 1) the association between multiple UEs and UAVs and 2) the resource allocation from UAVs to UEs, while minimizing the energy consumption for all the UEs. To address this, we formulate the above problem into a mixed integer nonlinear programming (MINLP), which is difficult to be solved in general, especially in the large-scale scenario. We then propose a Reinforcement Learning (RL)-based user Association and resource Allocation (RLAA) algorithm to tackle this problem efficiently and effectively. Numerical results show that the proposed RLAA can achieve the optimal performance with comparison to the exhaustive search in small scale, and have considerable performance gain over other typical algorithms in large-scale cases.
研究动机与目标
- 解决多无人机支持的MEC系统中,无人机为地面用户设备(UE)提供计算密集型任务时的高效用户关联与资源分配挑战。
- 在确保服务质量(QoS)约束满足的前提下,最小化所有UE的总能耗。
- 克服大规模场景下混合整数非线性规划(MINLP)公式在计算上的不可行性。
- 开发一种可扩展、自适应的解决方案,根据实时条件动态分配UE至无人机,并分配无线与计算资源。
- 在小规模与大规模设置下,评估所提出的RLAA算法与穷举搜索及传统启发式方法的性能表现。
提出的方法
- 将联合用户关联与资源分配问题建模为混合整数非线性规划(MINLP)问题,以最小化总能耗。
- 将系统建模为马尔可夫决策过程(MDP),其中状态包括UE位置、无人机位置、任务需求和信道条件。
- 设计基于深度Q网络(DQN)的强化学习智能体,通过探索与经验回放学习最优动作(无人机选择与时隙分配)。
- 定义密集奖励函数,对高能耗、任务违规和资源过载进行惩罚,以鼓励节能且可行的决策。
- 采用ε-greedy探索策略并结合衰减调度,以在训练过程中平衡探索与利用。
- 使用经验回放缓冲区与目标网络训练DQN智能体,以稳定学习过程并提升收敛性。
实验结果
研究问题
- RQ1基于强化学习的方法是否能在多无人机MEC系统的用户关联与资源分配中实现近似最优性能?
- RQ2在小规模场景中,所提出的RLAA算法与穷举搜索相比表现如何?
- RQ3在大规模部署中,RLAA相较于传统启发式方法(如贪心法、随机法、本地执行)的可扩展性与性能增益如何?
- RQ4RLAA算法在满足QoS与资源约束的前提下,对总能耗的降低程度如何?
- RQ5RLAA策略对UE分布与无人机移动性的动态变化具有多大程度的鲁棒性?
主要发现
- 在小规模场景(3–7个UE)中,RLAA算法达到与穷举搜索相同的最小能耗,证实其在低复杂度设置下的最优性。
- 在大规模场景(100–1000个UE)中,RLAA显著优于本地执行(LE)、随机卸载(RO)和贪心卸载(GO),大幅降低总能耗。
- 在3架无人机与1000个UE的配置下,RLAA的能耗低于GO、RO和LE,展现出强大的可扩展性与适应性。
- 当无人机数量增至5架时,RLAA仍持续优于所有基线方法,在所有UE中实现显著的能耗节省。
- 在高密度场景中,RLAA的性能增益最为显著,此时最优无人机选择与资源分配至关重要。
- 基于DQN的RLAA策略收敛稳定,并在不同UE分布与无人机配置下表现出良好的泛化能力,表明其具备鲁棒性与适应性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。