Skip to main content
QUICK REVIEW

[论文解读] Attractor Selection in Nonlinear Energy Harvesting Using Deep Reinforcement Learning

Xue-She Wang, Brian P. Mann|arXiv (Cornell University)|Oct 3, 2020
Innovative Energy Harvesting Technologies参考文献 52被引用 12
一句话总结

本文提出了一种基于深度强化学习(DRL)的控制策略,用于在具有平移-旋转磁耦合的非线性能量收集器中,在共存吸引子之间进行切换。采用深度确定性策略梯度(DDPG)算法,该方法可在最小能量消耗下实现高效的吸引子选择,在执行机构约束条件下成功实现了高功率与低功率状态之间的切换。

ABSTRACT

Recent research efforts demonstrate that the intentional use of nonlinearity enhances the capabilities of energy harvesting systems. One of the primary challenges that arise in nonlinear harvesters is that nonlinearities can often result in multiple attractors with both desirable and undesirable responses that may co-exist. This paper presents a nonlinear energy harvester which is based on translation-to-rotational magnetic transmission and exhibits coexisting attractors with different levels of electric power output. In addition, a control method using deep reinforcement learning was proposed to realize attractor switching between coexisting attractors with constrained actuation.

研究动机与目标

  • 解决非线性能量收集器中存在共存吸引子的问题,即在相同激励下,多个具有不同功率输出的稳定响应共存。
  • 开发一种控制策略,实现在高功率与低功率吸引子之间切换,同时最小化能量和时间消耗。
  • 设计一种强化学习框架,尊重物理执行机构约束,如有限的力、电压或能量输入。
  • 证明使用DRL学习非线性动力系统中复杂多稳态行为的最优控制策略的可行性。
  • 为未来基于迁移学习的实验实现提供仿真基础。

提出的方法

  • 采用基于平移-旋转磁传动的非线性能量收集器,其表现出具有不同功率输出的共存吸引子。
  • 构建强化学习环境,其中状态包括系统的位移、速度和电压,动作空间包括执行器位移或施加的电压。
  • 使用深度确定性策略梯度(DDPG)训练连续控制策略,以最大化一个平衡切换速度与能量成本的奖励函数。
  • 集成神经网络分类器,基于实时系统状态快速预测当前吸引子,实现准确的状态观测。
  • 实施两种控制机制:(1) 通过线性执行器控制弹簧位置;(2) 通过电压控制临时将发电机反转为电动机。
  • 定义一个奖励函数,对高能耗和长切换时间进行惩罚,以鼓励实现节能且快速的过渡。

实验结果

研究问题

  • RQ1深度强化学习能否在最小能量成本下有效实现非线性能量收集器中共存吸引子的切换?
  • RQ2在执行器力有限或最大电压等物理约束下,控制策略的性能如何?
  • RQ3在简化学习策略时,能量效率与控制平滑性之间的权衡是什么?
  • RQ4与简化的准bang-bang控制策略相比,基于DRL的控制器在能量和时间消耗方面表现如何?
  • RQ5DRL策略是否能在不同动作边界(如最大电压)下泛化,并保持切换性能的鲁棒性?

主要发现

  • 基于DDPG的控制策略在50组随机初始条件下,均以高可靠性实现了收集器在高功率(HP)和低功率(LP)吸引子之间的切换。
  • 在LP到HP切换中,电压控制(控制器II)比弹簧控制(控制器I)更具能量效率,在测试场景中能量消耗最多降低25%。
  • HP到LP切换的能量消耗高于LP到HP切换,因为需要破坏更高能量状态,且在更严格的执行机构边界下能量成本进一步上升。
  • 从DRL策略中简化得到的准bang-bang控制策略,虽然能量消耗高于原始DDPG策略,但执行器运动更平滑,表明存在效率与机械磨损之间的权衡。
  • 更小的电压动作边界(如±5 V对比±10 V)导致电压控制下的能量消耗增加,表明对电源约束较为敏感。
  • 在控制器I下,HP到LP切换平均需12.3个激励周期才能实现能量成本的盈亏平衡,而LP到HP切换为8.7个周期,表明破坏高能态的能量成本更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。