[论文解读] Reinforcement Learning-based Virtual Fixtures for Teleoperation of Hydraulic Construction Machine
本文提出了一种基于强化学习(RL)的虚拟夹具系统,通过数据驱动的仿真学习最优关节协调策略,以增强液压施工机械的遥操作性能。该框架通过学习到的虚拟夹具引导操纵杆输入,减轻了操作员的认知负荷,并提高了任务效率,用户研究结果表明,在将凿子插入孔洞的过程中,操作员的用力减少且末端执行器轨迹更加平滑。
The utilization of teleoperation is a crucial aspect of the construction industry, as it enables operators to control machines safely from a distance. However, remote operation of these machines at a joint level using individual joysticks necessitates extensive training for operators to achieve proficiency due to their multiple degrees of freedom. Additionally, verifying the machine resulting motion is only possible after execution, making optimal control challenging. In addressing this issue, this study proposes a reinforcement learning-based approach to optimize task performance. The control policy acquired through learning is used to provide instructions on efficiently controlling and coordinating multiple joints. To evaluate the effectiveness of the proposed framework, a user study is conducted with a Brokk 170 construction machine by assessing its performance in a typical construction task involving inserting a chisel into a borehole. The effectiveness of the proposed framework is evaluated by comparing the performance of participants in the presence and absence of virtual fixtures. This study results demonstrate the proposed framework potential in enhancing the teleoperation process in the construction industry.
研究动机与目标
- 解决使用独立操纵杆操作多自由度施工机械所带来的高认知与运动负荷问题。
- 在实时反馈有限的非结构化施工环境中,减少操作错误并提高任务效率。
- 开发一种基于数据驱动、仿真训练的强化学习框架,以捕捉特定机械的非线性动力学特性,而无需依赖详细的解析模型。
- 评估基于训练好的强化学习策略生成的虚拟夹具在真实世界遥操作任务中的有效性。
- 通过在训练环境中集成数据驱动的执行器模型,最小化仿真与现实之间的差异。
提出的方法
- 使用真实机械操作数据训练数据驱动的执行器模型,以在仿真中精确模拟非线性液压动力学。
- 在并行化的仿真环境中,使用128个智能体同时训练深度强化学习智能体,以学习锤击插入任务。
- 训练好的强化学习策略生成最优关节轨迹,并用于定义引导人类操作员的虚拟夹具。
- 虚拟夹具被实现为视觉和运动约束,提示最优操纵杆操作方式及关节协调模式。
- 系统采用动态仿真器,集成数据驱动的执行器模型,以确保训练和评估期间的运动逼真性。
- 通过用户研究,对比在使用和不使用虚拟夹具的情况下,使用Brokk 170机械在孔洞插入任务中的遥操作性能。
实验结果
研究问题
- RQ1基于数据驱动的强化学习框架能否在仿真与现实之间差异最小化的情况下,学习到高效且适用于液压施工机械遥操作的关节协调策略?
- RQ2基于训练好的强化学习策略生成的虚拟夹具在复杂遥操作任务中,对提升操作员表现有多有效?
- RQ3虚拟夹具在多关节施工机械的遥操作中,能在多大程度上降低认知负荷和身体用力?
- RQ4虚拟夹具是否能够引导操作员同时使用多个关节,从而实现更平滑、更高效的末端执行器轨迹?
- RQ5将真实机械数据整合到强化学习训练过程中,如何提升策略的泛化能力与任务表现?
主要发现
- 使用虚拟夹具的参与者在认知负荷和主观用力程度方面显著降低,NASA-TLX问卷结果证实了这一点。
- 虚拟夹具的使用促使操作员实现更协调的关节控制,表现为更倾向于同时移动多个关节,而非依次操作。
- 配备虚拟夹具的末端执行器轨迹更加平滑,所需移动次数更少,从而实现更快、更精确的孔洞插入。
- 虚拟夹具引导操作员保持与孔洞的最优距离,减少了所需的修正动作次数。
- 数据驱动的执行器模型有效缩小了仿真与现实之间的差距,使训练好的策略能够很好地泛化到真实世界的遥操作中。
- 该框架成功实现了在动态、非结构化环境中对复杂液压施工机械的安全且高效的遥操作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。