[论文解读] Deep Reinforcement Learning for Fresh Data Collection in UAV-assisted IoT Networks
本文提出了一种基于深度强化学习(DRL)的算法,用于无人机(UAV)辅助的物联网(IoT)网络,在时间和能量约束下最小化信息年龄(AoI)的加权和。通过将问题建模为有限时域马尔可夫决策过程(MDP),DRL智能体学习最优的无人机飞行轨迹和传感器传输调度,与基于AoI和基于距离的基线方法相比,显著降低了AoI。
Due to the flexibility and low operational cost, dispatching unmanned aerial vehicles (UAVs) to collect information from distributed sensors is expected to be a promising solution in Internet of Things (IoT), especially for time-critical applications. How to maintain the information freshness is a challenging issue. In this paper, we investigate the fresh data collection problem in UAV-assisted IoT networks. Particularly, the UAV flies towards the sensors to collect status update packets within a given duration while maintaining a non-negative residual energy. We formulate a Markov Decision Process (MDP) to find the optimal flight trajectory of the UAV and transmission scheduling of the sensors that minimizes the weighted sum of the age of information (AoI). A UAV-assisted data collection algorithm based on deep reinforcement learning (DRL) is further proposed to overcome the curse of dimensionality. Extensive simulation results demonstrate that the proposed DRL-based algorithm can significantly reduce the weighted sum of the AoI compared to other baseline algorithms.
研究动机与目标
- 通过最小化信息年龄(AoI)的加权和,解决在无人机辅助的物联网网络中保持数据新鲜度的挑战。
- 在时间和能量约束下,将无人机飞行轨迹和传感器传输调度建模为有限时域马尔可夫决策过程(MDP)。
- 利用深度强化学习克服因高维状态空间导致的MDP求解维度灾难问题。
- 设计一种基于DRL的算法,联合优化无人机移动性和传感器调度,以提升信息新鲜度。
- 在整个任务过程中确保无人机能量保持非负,同时最小化所有传感器的AoI。
提出的方法
- 将UAV-IoT网络建模为有限时域MDP,其中状态表示无人机位置、传感器AoI、剩余能量和时间。
- 将动作空间定义为在每个时隙选择一个飞行方向和一个连接的传感器。
- 实现一个深度Q网络(DQN),包含两个全连接隐藏层(分别包含200和256个神经元),以近似Q值函数。
- 使用经验回放和目标网络技术以稳定DQN训练并提高收敛性。
- 使用奖励函数训练DRL智能体,该函数对高AoI和高能耗进行惩罚,以鼓励及时且高效的数据显示收集。
- 将真实世界的无人机能量模型(例如,基于速度、高度和旋翼动力学的功耗)集成到环境动力学中。
实验结果
研究问题
- RQ1如何联合优化无人机飞行轨迹和传感器传输调度,以在能量受限的UAV-IoT网络中最小化AoI的加权和?
- RQ2所提出的基于DRL的方法在减少AoI方面,相较于启发式基线方法(如基于AoI和基于距离的策略)的性能提升程度如何?
- RQ3无人机的覆盖半径如何影响平均AoI?在空间覆盖与数据新鲜度之间存在何种权衡?
- RQ4传感器数量如何影响基于DRL的数据采集算法在AoI和能量效率方面的性能?
- RQ5深度强化学习能否有效处理无人机辅助物联网数据采集中高维状态空间和动态约束的挑战?
主要发现
- 所提出的基于DRL的算法相较于基于AoI和基于距离的基线算法,显著降低了AoI的加权和。
- 在传感器数量固定(N=3)的情况下,随着无人机覆盖半径R的增加,平均AoI降低,且DRL方法始终优于基线方法。
- 当传感器数量从N=3增加到N=10时,所有算法的平均AoI均上升,但基于DRL的方法在AoI增长方面表现出更明显的抑制效果,优于基线方法。
- 当覆盖半径R较大时,基于AoI的算法性能几乎与DRL方法相当,这是由于覆盖区域重叠使得单次飞越即可高效收集多个传感器的数据。
- DRL智能体学会了在AoI、能量和时间约束之间取得平衡,导致加权AoI随R增加而单调递减,随N增加而单调递增,符合预期。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。