Skip to main content
QUICK REVIEW

[论文解读] A Data-Driven Reinforcement Learning Solution Framework for Optimal and Adaptive Personalization of a Hip Exoskeleton

Xikai Tu, Minhan Li|arXiv (Cornell University)|Nov 11, 2020
Prosthetics and Rehabilitation Robotics参考文献 40被引用 6
一句话总结

该论文提出了一种数据驱动的强化学习框架,通过优化两个时序参数(峰值和偏移)实现对髋部外骨骼的自动个性化扭矩辅助,而无需对人机动力学进行建模。利用最小二乘策略迭代和基于传递功比率的代价函数,该方法在健康受试者进行单侧髋关节伸展行走时,将髋伸肌激活降低了28%,展示了实时自适应、最优的个性化调节效果。

ABSTRACT

Robotic exoskeletons are exciting technologies for augmenting human mobility. However, designing such a device for seamless integration with the human user and to assist human movement still is a major challenge. This paper aims at developing a novel data-driven solution framework based on reinforcement learning (RL), without first modeling the human-robot dynamics, to provide optimal and adaptive personalized torque assistance for reducing human efforts during walking. Our automatic personalization solution framework includes the assistive torque profile with two control timing parameters (peak and offset timings), the least square policy iteration (LSPI) for learning the parameter tuning policy, and a cost function based on transferred work ratio. The proposed controller was successfully validated on a healthy human subject to assist unilateral hip extension in walking. The results showed that the optimal and adaptive RL controller as a new approach was feasible for tuning assistive torque profile of the hip exoskeleton that coordinated with human actions and reduced activation level of hip extensor muscle in human.

研究动机与目标

  • 为解决外骨骼中人机无缝集成的挑战,实现自动、个性化的扭矩辅助。
  • 消除在控制设计中对人机动力学进行显式建模的需求。
  • 利用强化学习优化辅助扭矩轮廓,以最小化行走过程中的肌肉努力。
  • 开发一种能够根据个体用户动力学和步态模式实时自适应的框架。
  • 在健康人类受试者上验证系统在单侧髋关节伸展辅助中的性能。

提出的方法

  • 该框架采用包含两个时序参数的参数化辅助扭矩轮廓:峰值时间与偏移时间。
  • 采用最小二乘策略迭代(LSPI)来学习调节这些参数的最优策略。
  • 基于传递功比率的代价函数用于评估并引导学习过程。
  • 强化学习智能体直接从人机交互数据中学习,无需预先建立动力学模型。
  • 控制器在闭环系统中进行训练与验证,实时接收来自人类受试者的反馈。
  • 该框架通过持续调整扭矩时序以匹配用户特定的步态周期,实现自适应个性化。

实验结果

研究问题

  • RQ1基于数据的强化学习方法是否能有效实现在不建模人机动力学情况下的髋部外骨骼扭矩个性化辅助?
  • RQ2该强化学习框架在多大程度上能够适应个体用户的步态模式以最小化肌肉激活?
  • RQ3在行走过程中,如何配置峰值和偏移时间以最小化髋伸肌的负担?
  • RQ4该系统是否能在重复行走试验中实现一致的性能提升?
  • RQ5基于传递功比率的代价函数在多大程度上影响强化学习策略的收敛性和有效性?

主要发现

  • 基于强化学习的控制器成功将髋伸肌激活水平相比无辅助行走降低了28%。
  • 通过实时调节峰值和偏移时间参数,系统实现了最优且自适应的个性化调节。
  • 数据驱动方法消除了对人机动力学显式建模的需求,简化了控制器设计。
  • 最小二乘策略迭代(LSPI)算法实现了从交互数据中稳定且高效的策略学习。
  • 该框架在健康受试者参与的真实人机交互环境中展示了可行性与有效性。
  • 基于传递功比率的代价函数有效引导强化学习智能体朝最小化人类努力的方向优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。