[论文解读] Predicting Driver Attention in Critical Situations
本文提出了一种新颖的室内实验室驾驶员注意力采集协议及伯克利深度驾驶注意力(BDD-A)数据集,实现了对关键驾驶场景中驾驶员注意力的高质量、可扩展标注。通过使用人类加权采样(HWS)方法,根据人类注视行为优先选择关键帧,作者训练了一个深度学习模型,在预测驾驶员注意力方面达到最先进性能——在感知能力和对真实车载数据的泛化性方面表现出与人类相当的相似性。
Robust driver attention prediction for critical situations is a challenging computer vision problem, yet essential for autonomous driving. Because critical driving moments are so rare, collecting enough data for these situations is difficult with the conventional in-car data collection protocol---tracking eye movements during driving. Here, we first propose a new in-lab driver attention collection protocol and introduce a new driver attention dataset, Berkeley DeepDrive Attention (BDD-A) dataset, which is built upon braking event videos selected from a large-scale, crowd-sourced driving video dataset. We further propose Human Weighted Sampling (HWS) method, which uses human gaze behavior to identify crucial frames of a driving dataset and weights them heavily during model training. With our dataset and HWS, we built a driver attention prediction model that outperforms the state-of-the-art and demonstrates sophisticated behaviors, like attending to crossing pedestrians but not giving false alarms to pedestrians safely walking on the sidewalk. Its prediction results are nearly indistinguishable from ground-truth to humans. Although only being trained with our in-lab attention data, the model also predicts in-car driver attention data of routine driving with state-of-the-art accuracy. This result not only demonstrates the performance of our model but also proves the validity and usefulness of our dataset and data collection protocol.
研究动机与目标
- 解决稀有、关键驾驶事件中车载驾驶员注意力数据稀缺与偏差的问题。
- 开发一种可扩展的室内实验室数据采集协议,通过众包驾驶视频与多观察者注视平均,模拟真实世界驾驶员注意力。
- 创建一个专注于制动事件、交互密度高的新型大规模驾驶员注意力数据集(BDD-A)。
- 通过引入人类加权采样(HWS),根据注意力重要性重新加权帧,提升模型在关键时刻的泛化能力与性能。
- 训练一个驾驶员注意力预测模型,在室内实验室与车载数据上均达到或超越最先进性能。
提出的方法
- 提出一种新的室内实验室驾驶员注意力采集协议:在模拟驾驶任务中向多名观察者播放众包驾驶视频,并对其注视响应进行平均,生成多焦点注意力图。
- 从大规模众包驾驶视频数据集中选取制动事件片段,结合室内人类注视数据标注,构建伯克利深度驾驶注意力(BDD-A)数据集。
- 提出人类加权采样(HWS):利用人类注视模式识别并为高注意力需求的帧分配更高训练权重,尤其在关键事件期间。
- 使用BDD-A数据集与HWS训练深度神经网络进行驾驶员注意力预测,损失函数同时优化整体准确率与关键时刻性能。
- 在30分钟车载DR(eye)VE数据集片段(含室内标注)的小样本子集上微调模型,以适应高速高速公路条件。
- 使用标准指标(差异度、皮尔逊相关系数、NSS、AUC)及人类判断研究,对比模型预测与真实注意力图。
实验结果
研究问题
- RQ1从多名观察者收集的室内第三人称注视数据,能否可靠地近似熟练驾驶员在关键驾驶情境下的应关注位置?
- RQ2与均匀采样相比,人类加权采样(HWS)是否能显著提升模型在稀有、高风险驾驶事件中的性能?
- RQ3仅在室内注意力数据上训练的模型,能否在真实车载驾驶场景中实现高精度泛化?
- RQ4与最先进模型相比,所提模型在感知上与人类注意力的相似性如何?
- RQ5模型预测在多大程度上反映了准确的风险感知,例如关注横穿马路的行人,同时忽略安全人行道上的行人?
主要发现
- 所提出的室内数据采集协议生成的注意力图被评价为比车载数据更贴近最优驾驶员注意力,41%的人类评委更偏好模型预测结果而非室内人类注意力图(p = 4×10⁻⁵)。
- HWS方法显著提升了模型在关键帧上的性能,对稀有、高风险事件的准确率增益高于均匀采样。
- 在仅额外微调30分钟室内标注数据后,模型在DR(eye)VE车载数据集上达到最先进性能,KL散度与相关系数的95%置信区间存在重叠。
- 模型展现出复杂的注意力行为,能正确关注横穿道路的行人,同时避免对人行道上行人的误报。
- 人类评委认为模型预测与真实人类注意力图几乎无法区分,表明其具有极高的感知保真度。
- 微调后的模型在关键类别(车辆、行人、骑行者)中关注物体的比例显著高于DR(eye)VE模型,更贴近室内人类注意力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。