Skip to main content
QUICK REVIEW

[论文解读] tinyMAN: Lightweight Energy Manager using Reinforcement Learning for Energy Harvesting Wearable IoT Devices

Toygun Başaklar, Yiğit Tuncel|arXiv (Cornell University)|Feb 18, 2022
Energy Harvesting in Wireless Networks被引用 7
一句话总结

tinyMAN 是一种轻量级、基于强化学习的能量管理器,专为能量采集可穿戴物联网设备设计,无需能量预测即可运行。它采用近端策略优化(PPO)算法,动态分配采集到的能量以最大化设备效用,在每推理消耗低于 27.75 µJ、内存占用不足 100 KB 的前提下,性能相比以往方法最高提升 45%。

ABSTRACT

Advances in low-power electronics and machine learning techniques lead to many novel wearable IoT devices. These devices have limited battery capacity and computational power. Thus, energy harvesting from ambient sources is a promising solution to power these low-energy wearable devices. They need to manage the harvested energy optimally to achieve energy-neutral operation, which eliminates recharging requirements. Optimal energy management is a challenging task due to the dynamic nature of the harvested energy and the battery energy constraints of the target device. To address this challenge, we present a reinforcement learning-based energy management framework, tinyMAN, for resource-constrained wearable IoT devices. The framework maximizes the utilization of the target device under dynamic energy harvesting patterns and battery constraints. Moreover, tinyMAN does not rely on forecasts of the harvested energy which makes it a prediction-free approach. We deployed tinyMAN on a wearable device prototype using TensorFlow Lite for Micro thanks to its small memory footprint of less than 100 KB. Our evaluations show that tinyMAN achieves less than 2.36 ms and 27.75 $\\mu$J while maintaining up to 45% higher utility compared to prior approaches.

研究动机与目标

  • 解决资源受限可穿戴物联网设备在电池容量有限且能量采集动态变化情况下的能量管理挑战。
  • 在不依赖能量预测的前提下实现能量中性运行,确保对不可预测的环境能量源具有鲁棒性。
  • 通过自适应的实时能量分配,在不同电池电量和采集能量模式下最大化设备效用。
  • 设计可在低端微控制器上部署的解决方案,实现极低的执行时间、能量开销和内存占用。

提出的方法

  • 采用近端策略优化(PPO)这一深度强化学习算法,学习连续动作空间中的最优能量分配策略。
  • 将能量管理问题建模为马尔可夫决策过程(MDP),以电池电量和历史采集能量作为状态输入。
  • 设计一种通用的奖励函数,基于能耗反映设备效用,实现对多样化应用的兼容性。
  • 利用来自美国时间使用调查的真实数据以及光能和动能双模能量采集方式,在合成环境中训练智能体。
  • 使用 TensorFlow Lite for Micro(TFLM)将训练好的模型部署在 TI CC2652R 微控制器上,以确保极低的内存和能量开销。
  • 优化模型大小与推理效率,在不同硬件约束下平衡性能、内存使用与能量消耗。

实验结果

研究问题

  • RQ1基于强化学习的能量管理器是否能在能量采集可穿戴物联网设备中实现比现有预测型或启发式方法更高的设备效用?
  • RQ2轻量级强化学习智能体在无能量预测的情况下,能在多大程度上有效应对动态且不可预测的采集模式?
  • RQ3在资源受限的可穿戴微控制器上,强化学习智能体的内存占用和能量开销如何随模型大小变化?
  • RQ4训练好的智能体是否能泛化到训练过程中未见过的用户特定能量采集模式和电池状态?

主要发现

  • 与最先进方法相比,tinyMAN 实现了最高 45% 的设备效用提升,归一化效用达到最优解的 86%。
  • 该框架在所有测试场景中均保持能量中性,确保无需充电即可持续运行。
  • tinyMAN 的推理能耗最低可达 6.74 µJ(16 个神经元模型),最大为 27.75 µJ(64 个神经元模型)。
  • 每次推理的执行时间低于 2.36 ms,即使在集成额外驱动程序和 I/O 组件的情况下,内存占用也低于 100 KB。
  • 更小的模型变体(16 和 32 个神经元)分别将能耗和内存使用降低 75% 和 50%,仅导致归一化效用下降 7%。
  • 由于在多样化能量采集分布和初始电池状态上进行训练,该智能体对未见过的用户模式具有良好的泛化能力,展现出强大的适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。