[论文解读] Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference
该论文提出了一种新颖的不确定性感知多模态音视频行为识别框架,采用深度贝叶斯变分推断,结合确定性和变分层以扩展贝叶斯深度网络,实现更优的不确定性估计。该方法在UCF101和Moments-in-Time数据集上,相较于非贝叶斯基线模型,将精确率-召回率AUC提升了10.2%,并能有效识别分布外样本。
Deep neural networks (DNNs) provide state-of-the-art results for a multitude of applications, but the approaches using DNNs for multimodal audiovisual applications do not consider predictive uncertainty associated with individual modalities. Bayesian deep learning methods provide principled confidence and quantify predictive uncertainty. Our contribution in this work is to propose an uncertainty aware multimodal Bayesian fusion framework for activity recognition. We demonstrate a novel approach that combines deterministic and variational layers to scale Bayesian DNNs to deeper architectures. Our experiments using in- and out-of-distribution samples selected from a subset of Moments-in-Time (MiT) dataset show a more reliable confidence measure as compared to the non-Bayesian baseline and the Monte Carlo dropout (MC dropout) approximate Bayesian inference. We also demonstrate the uncertainty estimates obtained from the proposed framework can identify out-of-distribution data on the UCF101 and MiT datasets. In the multimodal setting, the proposed framework improved precision-recall AUC by 10.2% on the subset of MiT dataset as compared to non-Bayesian baseline.
研究动机与目标
- 解决在使用深度神经网络进行多模态音视频行为识别时缺乏预测不确定性建模的问题。
- 开发一种可扩展的贝叶斯深度学习架构,整合确定性和变分层以支持更深的模型。
- 通过量化模态特定的不确定性,实现可靠的不确定性感知多模态融合。
- 利用不确定性估计在音视频识别任务中识别分布外样本。
- 在存在噪声或模糊输入的真实世界部署场景中,提升模型的可靠性与鲁棒性。
提出的方法
- 提出一种混合贝叶斯深度神经网络架构,结合确定性和变分层,将贝叶斯深度学习扩展至更深的网络。
- 采用随机变分推断(SVI)近似网络权重的后验分布,实现不确定性量化。
- 通过在权重后验分布上进行边缘化推断,计算预测不确定性,实现贝叶斯神经网络推理。
- 应用BALD和预测熵等不确定性度量,检测分布外输入。
- 将模态特定的不确定性估计集成到多模态融合策略中,提升决策置信度与准确性。
- 使用Moments-in-Time(MiT)数据集进行训练,并在MiT和UCF101的分布内与分布外样本上进行评估。
实验结果
研究问题
- RQ1基于变分推断的贝叶斯深度学习框架是否能在音视频行为识别中提供比非贝叶斯DNN和MC dropout更可靠的不确定性估计?
- RQ2所提出的确定性-变分混合架构在保持不确定性估计性能的前提下,能否有效扩展至更深的网络?
- RQ3所提出框架的不确定性估计是否能有效识别音视频识别任务中的分布外样本?
- RQ4与标准非贝叶斯融合相比,不确定性感知的多模态融合是否能提升精确率-召回率AUC?
- RQ5不同不确定性度量(如BALD、预测熵)在区分分布内与分布外输入方面表现如何?
主要发现
- 所提出的采用随机变分推断的贝叶斯DNN在MiT数据集上相较于非贝叶斯DNN基线,将精确率-召回率AUC提升了10.2%。
- 在音视频融合任务中,贝叶斯DNN模型的Top-1和Top-5准确率分别达到58.2%和83.8%,高于非贝叶斯DNN的56.61%和79.39%。
- 所提出框架的不确定性估计在分布内与分布外样本之间表现出清晰的分离,如BALD和预测熵的密度直方图所示。
- 该模型在准确率和不确定性校准方面均优于基于MC dropout的贝叶斯DNN,在音视频任务中实现了3.8%更高的精确率-召回率AUC。
- 采用随机VI的贝叶斯DNN相较于仅使用视觉模态的贝叶斯DNN,Top-1准确率提升了9.2%,表明模态特定不确定性有效融合。
- 当在UCF101的分布内样本上测试时,该框架成功识别出来自MiT数据集的分布外数据,证实了对分布偏移的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。