Skip to main content
QUICK REVIEW

[论文解读] Learning to Minimize Age of Information over an Unreliable Channel with Energy Harvesting

Elif Tuğçe Ceran, Denız Gündüz|arXiv (Cornell University)|Jun 30, 2021
Age of Information Optimization参考文献 38被引用 11
一句话总结

本文提出了一种强化学习框架,以最小化能量采集系统中不可靠信道下的年龄信息(AoI),同时考虑感知和传输的能量成本。该研究引入了基于阈值的策略,并评估了基于价值、策略梯度和深度Q网络的方法,结果表明,在信道和能量统计特性未知的情况下,利用阈值结构的策略梯度方法优于其他强化学习方法。

ABSTRACT

The time average expected age of information (AoI) is studied for status updates sent over an error-prone channel from an energy-harvesting transmitter with a finite-capacity battery. Energy cost of sensing new status updates is taken into account as well as the transmission energy cost better capturing practical systems. The optimal scheduling policy is first studied under the hybrid automatic repeat request (HARQ) protocol when the channel and energy harvesting statistics are known, and the existence of a threshold-based optimal policy is shown. For the case of unknown environments, average-cost reinforcement-learning algorithms are proposed that learn the system parameters and the status update policy in real-time. The effectiveness of the proposed methods is demonstrated through numerical results.

研究动机与目标

  • 最小化具有不可靠信道和有限电池容量的能量采集状态更新系统中的时间平均期望AoI。
  • 同时考虑感知和传输能量成本,以更好地建模实际的物联网和传感器网络。
  • 在信道和能量采集统计特性未知的情况下,开发自适应学习策略。
  • 证明强化学习算法在不确定性环境下学习最优更新策略的有效性。

提出的方法

  • 将问题建模为马尔可夫决策过程(MDP),其状态空间包括AoI、重传次数、电池电量和能量采集状态。
  • 在已知信道和能量统计特性下,提出基于阈值的最优策略,并通过Q函数的子模性证明其最优性。
  • 采用平均成本强化学习算法:GR-learning(基于价值)、有限差分策略梯度(FDPG)和深度Q网络(DQN),用于未知环境。
  • 提出一种利用阈值策略结构特性的策略梯度方法,以提高学习效率和性能。
  • 使用相对值迭代(RVI)作为已知系统参数下的基准,以评估强化学习算法的性能。
  • 通过数值结果验证所提方法,比较不同强化学习算法和系统配置下的AoI性能。

实验结果

研究问题

  • RQ1在具有感知和传输能量成本、且信道不可靠的能量采集系统中,最小化AoI的最优状态更新策略是什么?
  • RQ2引入感知成本后,如何影响失败更新重传与发送新更新之间的权衡?
  • RQ3当信道和能量采集统计特性未知时,强化学习算法能否有效学习最优更新策略?
  • RQ4在AoI最小化中,利用策略梯度方法中的阈值结构是否优于通用强化学习方法?
  • RQ5在系统动态未知的情况下,不同强化学习算法(GR-learning、FDPG、DQN)在AoI性能和收敛速度方面如何比较?

主要发现

  • 在已知信道和能量统计特性下,存在一种基于阈值的策略可实现最优AoI最小化,其最优性通过Q函数的子模性得到证明。
  • 所提出的利用阈值结构的策略梯度方法在最小化AoI方面优于GR-learning和其他基线强化学习算法。
  • 数值结果表明,即使系统参数未知,FDPG和DQN算法也能收敛到近似最优策略。
  • 基于强化学习的策略的AoI性能接近RVI基准(具备完整系统知识),表明其在未知环境下的有效适应能力。
  • 引入感知成本显著改变了最优更新策略,使得在能量稀缺时重传策略更具优势。
  • DQN和FDPG方法的平均AoI低于GR-learning,且FDPG在测试场景中表现出更快的收敛速度和更好的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。