[论文解读] Real-Time Posture Monitoring and Risk Assessment for Manual Lifting Tasks Using MediaPipe and LSTM
本文提出了一种基于 MediaPipe 姿态估计和基于 LSTM 的模型进行时序姿态分析的实时姿态监测与风险评估系统,用于人工搬运作业。该系统在分类搬运姿势方面实现了 93.75% 的准确率,并通过网页界面提供即时反馈,其准确性和实时响应性能显著优于现有方法。
This research focuses on developing a real-time posture monitoring and risk assessment system for manual lifting tasks using advanced AI and computer vision technologies. Musculoskeletal disorders (MSDs) are a significant concern for workers involved in manual lifting, and traditional methods for posture correction are often inadequate due to delayed feedback and lack of personalized assessment. Our proposed solution integrates AI-driven posture detection, detailed keypoint analysis, risk level determination, and real-time feedback delivered through a user-friendly web interface. The system aims to improve posture, reduce the risk of MSDs, and enhance user engagement. The research involves comprehensive data collection, model training, and iterative development to ensure high accuracy and user satisfaction. The solution's effectiveness is evaluated against existing methodologies, demonstrating significant improvements in real-time feedback and risk assessment. This study contributes to the field by offering a novel approach to posture correction that addresses existing gaps and provides practical, immediate benefits to users.
研究动机与目标
- 解决传统人工搬运姿势矫正方法中反馈延迟且缺乏个性化的问题。
- 通过实时检测不正确搬运姿势,降低与工作相关的肌肉骨骼疾病(WMSDs)的风险。
- 开发一种集计算机视觉、序列建模与实时反馈于一体的系统,适用于实际工作场景。
- 通过直观的基于网页的界面提高用户参与度和对安全搬运习惯的依从性。
- 评估系统性能与现有模型的对比,证明其在准确性和泛化能力方面的优越性。
提出的方法
- 利用 MediaPipe Pose 从网络摄像头视频流中实时检测 33 个关键点标志,提供 2D 和 3D 身体姿态数据。
- 采用自定义的长短期记忆(LSTM)网络,对姿态关键点的时间序列进行建模,以检测高风险搬运模式。
- 处理来自多个角度和距离的视频数据,以增强模型在多样化真实环境条件下的鲁棒性和泛化能力。
- 应用风险分析框架,基于从关键点配置中提取的生物力学标准,将姿势分类为低、中或高风险等级。
- 在包含正确与错误搬运技术的多样化、迭代收集的视频数据集上训练 LSTM 模型。
- 通过响应式网页界面部署系统,实现在搬运任务过程中向用户提供实时的视觉与文本反馈。
实验结果
研究问题
- RQ1基于 LSTM 的模型能否有效且实时地从时序关键点数据中分类高风险人工搬运姿势?
- RQ2与 YOLOv7 搭配 LSTM 及 LSTM Pose Machines 等现有方法相比,所提出的系统在准确性和响应速度方面表现如何?
- RQ3实时反馈在多大程度上提升了用户在搬运任务中的姿势矫正效果和参与度?
- RQ4数据集的多样性及迭代式数据收集对模型泛化能力和性能有何影响?
- RQ5基于 MediaPipe 和 LSTM 的轻量化、基于网页的系统能否为职业环境中的 WMSD 预防提供实用且可扩展的解决方案?
主要发现
- 所提出的基于 LSTM 的模型实现了 0.9565 的类别准确率和 0.9375 的总体准确率,优于 YOLOv7 搭配 LSTM(0.8615 和 0.8536)以及 LSTM Pose Machines(0.8348 和 0.8085)。
- 由于其精简的架构和对时序姿态动态的专注,系统在泛化能力和实时响应方面表现出色。
- 风险分析框架的集成实现了对姿势的动态分类,分为低、中或高风险等级,显著提升了实际可用性。
- 使用在不同角度和距离下采集的多样化视频数据,显著增强了模型在真实环境条件下的鲁棒性与适应能力。
- 基于网页的界面实现了低延迟反馈,提高了用户参与度,并促进了对安全搬运技术的依从性。
- 对比评估证实,所提出的模型在准确性、效率和实时性能之间实现了优于现有解决方案的平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。