Skip to main content
QUICK REVIEW

[论文解读] Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

Jiyao Wang, Xiao Yang|arXiv (Cornell University)|Oct 28, 2024
Sleep and Work-Related FatiguePsychology被引用 3
一句话总结

该论文提出VDMoE,一种计算高效的混合专家(MoE)模型,利用RGB视频和远程光电容积脉搏波(rPPG)联合估计SAE Level-2/3自动驾驶中的驾驶员困倦度、认知负荷、心率和呼吸率。通过使用面部关键点特征和包含先验信息的正则化损失,VDMoE在保持高精度的同时最小化计算成本,其有效性在新构建的数据集(MCDD)和公开基准上得到验证。

ABSTRACT

Road safety remains a critical challenge worldwide, with approximately 1.35 million fatalities annually attributed to traffic accidents, often due to human errors. As we advance towards higher levels of vehicle automation, challenges still exist, as driving with automation can cognitively over-demand drivers if they engage in non-driving-related tasks (NDRTs), or lead to drowsiness if driving was the sole task. This calls for the urgent need for an effective Driver Monitoring System (DMS) that can evaluate cognitive load and drowsiness in SAE Level-2/3 autonomous driving contexts. In this study, we propose a novel multi-task DMS, termed VDMoE, which leverages RGB video input to monitor driver states non-invasively. By utilizing key facial features to minimize computational load and integrating remote Photoplethysmography (rPPG) for physiological insights, our approach enhances detection accuracy while maintaining efficiency. Additionally, we optimize the Mixture-of-Experts (MoE) framework to accommodate multi-modal inputs and improve performance across different tasks. A novel prior-inclusive regularization method is introduced to align model outputs with statistical priors, thus accelerating convergence and mitigating overfitting risks. We validate our method with the creation of a new dataset (MCDD), which comprises RGB video and physiological indicators from 42 participants, and two public datasets. Our findings demonstrate the effectiveness of VDMoE in monitoring driver states, contributing to safer autonomous driving systems. The code and data will be released.

研究动机与目标

  • 解决SAE Level-2/3自动驾驶车辆中对实时、非侵入式驾驶员监控的迫切需求,以防止因困倦或认知超载导致的事故。
  • 克服现有基于视频的驾驶员状态监测系统(DMS)依赖全帧输入(计算成本高)或单任务估计(无法满足现实复杂性需求)的局限性。
  • 开发一种多任务、高效的深度学习框架,从面部视频和rPPG信号中联合估计困倦度、认知负荷、心率和呼吸率。
  • 通过将统计先验整合到损失函数中,提升模型鲁棒性与收敛性,使预测结果与已知的生理与行为模式保持一致。
  • 构建并发布一个大规模、多模态的新数据集(MCDD),以支持在认知与生理状态共现条件下的条件自动驾驶场景研究。

提出的方法

  • 提出VDMoE,一种使用轻量级多层感知机(MLPs)作为专家的多任务混合专家(MoE)架构,实现高效计算与输入动态路由。
  • 使用面部关键点特征(如眼区与口区)作为输入,以降低计算负载,同时保留与困倦度和认知状态相关的时空动态信息。
  • 从面部视频中提取远程光电容积脉搏波(rPPG)信号,用于估计心率、呼吸率等生理指标。
  • 提出一种新颖的包含先验信息的正则化损失 $\mathcal{L}_{\text{align}}$,使模型输出与已知统计先验(如HR/RR的预期范围)对齐,从而提升收敛速度并减少过拟合。
  • 设计MoE门控机制,动态将输入路由至任务特定的专家,实现每个输出头(困倦度、认知负荷、HR、RR)的专用处理。
  • 采用任务特定损失与对齐先验损失的组合,端到端训练模型,确保在多样化驾驶条件下兼具高精度与良好泛化能力。

实验结果

研究问题

  • RQ1轻量级、多任务MoE模型能否在单次推理中有效估计RGB视频与rPPG信号中的多个驾驶员状态(困倦度、认知负荷)和生理指标(HR、RR)?
  • RQ2在数据有限的情况下,将统计先验整合到损失函数中,是否能提升模型在驾驶员状态估计中的收敛性与泛化能力?
  • RQ3与全帧视频相比,使用面部关键点特征在多任务驾驶员监控中是否能显著降低计算成本,同时不牺牲性能?
  • RQ4所提出的VDMoE模型在存在环境变化(如光照、运动等)的情况下,能否在多样化驾驶条件与个体差异中保持良好泛化能力?
  • RQ5新采集的大规模数据集(MCDD)是否能通过捕捉模拟SAE Level-2/3驾驶场景中认知负荷与困倦度的共现状态,支持对多任务DMS模型进行更稳健、更真实的评估?

主要发现

  • VDMoE在新收集的MCDD数据集及两个公开基准上,于所有四项任务(困倦度检测、认知负荷估计、心率、呼吸率)中均达到当前最优性能。
  • 通过使用面部关键点特征与基于MLP的专家,模型展现出显著的计算效率,相比3D-CNN或Transformer基线模型,FLOPs显著降低,同时保持高精度。
  • 包含先验信息的正则化损失 $\mathcal{L}_{\text{align}}$ 通过将预测结果约束在生物学上合理的范围内,加速了训练收敛并减少了过拟合,尤其在低数据场景下效果显著。
  • MCDD数据集由42名参与者在驾驶模拟器中采集,任务条件受控,真实捕捉了认知负荷与困倦度的共现状态,为多任务DMS的更稳健评估提供了支持。
  • 实证结果表明,联合估计多个驾驶员状态相比单任务基线模型,整体性能更优,验证了多任务归纳偏差的有效性。
  • 模型在不同参与者与驾驶场景中表现出良好泛化能力,在模拟器中不同光照与运动条件下均保持一致性能,表明其在真实场景中具备实际部署潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。