[论文解读] DADA: A Large-scale Benchmark and Model for Driver Attention Prediction in Accidental Scenarios.
本文提出了 DADA-2000,一个大规模基准数据集,包含 2000 个视频序列,用于在正常、紧急和事故交通场景下预测驾驶员注意力。该研究提出 MSAFNet,一种多路径语义引导注意力融合网络,能够建模时空语义和场景变化,在新基准上实现了最先进性能,其详细标注包括注视点、扫视、聚焦时间、事故物体及类别。
Driver attention prediction has recently absorbed increasing attention in traffic scene understanding and is prone to be an essential problem in vision-centered and human-like driving systems. This work, different from other attempts, makes an attempt to predict the driver attention in accidental scenarios containing normal, critical and accidental situations simultaneously. However, challenges tread on the heels of that because of the dynamic traffic scene, intricate and imbalanced accident categories. With the hypothesis that driver attention can provide a selective role of crash-object for assisting driving accident detection or prediction, this paper designs a multi-path semantic-guided attentive fusion network (MSAFNet) that learns the spatio-temporal semantic and scene variation in prediction. For fulfilling this, a large-scale benchmark with 2000 video sequences (named as DADA-2000) is contributed with laborious annotation for driver attention (fixation, saccade, focusing time), accident objects/intervals, as well as the accident categories, and superior performance to state-of-the-arts are provided by thorough evaluations. As far as we know, this is the first comprehensive and quantitative study for the human-eye sensing exploration in accidental scenarios. DADA-2000 is available at this https URL.
研究动机与目标
- 为解决在涵盖正常、紧急和事故状况的多样化交通场景中,驾驶员注意力预测缺乏全面且大规模数据集的问题。
- 开发一种深度学习模型,以捕捉动态交通环境中复杂的时空语义和场景变化。
- 通过详细、多层次的标注,实现对事故相关情境下人类视觉感知行为的定量分析。
- 建立一个基准,以支持视觉中心化、类人驾驶系统的开发与评估。
提出的方法
- 设计一种多路径语义引导注意力融合网络(MSAFNet),以整合来自视频输入的多尺度时空特征。
- 采用注意力机制,动态强调对事故预测至关重要的相关视觉线索和场景变化。
- 利用大规模视频数据集(DADA-2000),其包含人工标注的驾驶员注意力(注视点、扫视、聚焦时间)、事故物体及事故类别。
- 在 DADA-2000 上端到端训练 MSAFNet 模型,以预测不同交通条件下的驾驶员注意力。
- 引入场景变化建模,以提升在多样化和复杂交通场景下的鲁棒性。
- 通过在新基准上与最先进方法的全面评估,验证模型性能。
实验结果
研究问题
- RQ1如何在统一框架下有效预测正常、紧急和事故交通场景中的驾驶员注意力?
- RQ2时空语义理解在提升动态交通场景中注意力预测准确性方面发挥何种作用?
- RQ3多路径注意力融合网络在捕捉场景变化和事故相关线索方面,相较于现有模型能有多大程度的性能提升?
- RQ4详细、多层次的标注(包括注视点、扫视、聚焦时间、事故物体)在多大程度上提升了模型性能与可解释性?
- RQ5像 DADA-2000 这样大规模且多样化的基准,是否能够实现对驾驶员注意力预测模型更可靠且泛化性更强的评估?
主要发现
- 所提出的 MSAFNet 模型在 DADA-2000 基准上相比最先进方法表现更优,证明其在多样化交通场景中预测驾驶员注意力的准确性显著提升。
- 多路径特征提取与语义引导注意力机制的结合,显著增强了模型检测与事故相关视觉线索的能力。
- DADA-2000 基准提供了全面且大规模的资源,其对注视点、扫视、聚焦时间、事故物体及类别的详细标注,支持更细致的分析。
- 该模型在各类别不平衡的事故类别中表现出稳健性能,表明通过注意力特征学习有效处理了类别不平衡问题。
- 本研究首次实现了对事故情境下人类视觉感知的全面且定量的探索,为未来研究设立了新标准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。