[论文解读] Benchmarking the Robustness of Spatial-Temporal Models Against Corruptions
本文提出了 Mini Kinetics-C 和 Mini SSV2-C,作为评估视频分类模型在空间和时间退化下鲁棒性的基准。研究发现,基于 Transformer 的模型在鲁棒性方面优于 CNN,时间鲁棒性随模型容量和计算成本增加而提升,而通过退化数据进行训练反而会降低性能,这挑战了图像任务中常见的鲁棒性策略。
The state-of-the-art deep neural networks are vulnerable to common corruptions (e.g., input data degradations, distortions, and disturbances caused by weather changes, system error, and processing). While much progress has been made in analyzing and improving the robustness of models in image understanding, the robustness in video understanding is largely unexplored. In this paper, we establish a corruption robustness benchmark, Mini Kinetics-C and Mini SSV2-C, which considers temporal corruptions beyond spatial corruptions in images. We make the first attempt to conduct an exhaustive study on the corruption robustness of established CNN-based and Transformer-based spatial-temporal models. The study provides some guidance on robust model design and training: Transformer-based model performs better than CNN-based models on corruption robustness; the generalization ability of spatial-temporal models implies robustness against temporal corruptions; model corruption robustness (especially robustness in the temporal domain) enhances with computational cost and model capacity, which may contradict the current trend of improving the computational efficiency of models. Moreover, we find the robustness intervention for image-related tasks (e.g., training models with noise) may not work for spatial-temporal models.
研究动机与目标
- 为解决视频模型在时间退化下系统性评估的缺失,而时间退化在真实世界视频数据中普遍存在。
- 建立一个包含空间和时间退化的基准,以反映真实世界视频退化模式,如运动模糊、数据包丢失和天气影响等。
- 评估最先进 3D CNN 和视觉 Transformer 模型在这些退化下的鲁棒性,重点关注泛化能力与效率之间的权衡。
- 探究图像分类中有效的数据增强策略(如添加噪声训练)是否可迁移至视频理解任务。
- 通过分析架构、训练数据和模型容量的影响,为设计更鲁棒的视频模型提供可操作的见解。
提出的方法
- 通过在 Kinetics 和 SSV2 数据集的干净验证集上应用 12 种退化类型(每种 5 个严重等级),构建了两个视频基准——Mini Kinetics-C 和 Mini SSV2-C。
- 将退化分为空间(帧级)和时间(多帧,如运动模糊、数据包丢失)两类,以反映真实世界视频退化模式。
- 应用包括快门噪声、雨天、雾天、运动模糊、帧率降低、ABR/CRF、比特错误和数据包丢失等退化,以模拟系统和环境引起的失真。
- 使用 mPC(平均每类准确率)和 rPC(鲁棒性每类准确率)作为指标,在干净和退化数据上评估最先进 3D CNN 和视觉 Transformer 模型。
- 在单一退化类型(严重等级 3)的退化数据上训练模型,以评估泛化与鲁棒性之间的权衡。
- 采用 3D ResNet-18 作为主干网络,并在 Kinetics 的 40 类子集上进行训练,以确保模型间可复现性和公平比较。
实验结果
研究问题
- RQ1当视频分类模型依赖时间信息时,尤其在时间退化下,其鲁棒性如何?
- RQ2在视频模型中,空间退化与时间退化带来的鲁棒性差异是什么?
- RQ3在视频分类中,模型泛化能力、计算效率与鲁棒性之间的权衡如何?
- RQ4在图像分类中有效的噪声或退化数据增强策略是否能提升视频模型的鲁棒性,如同在图像任务中一样?
- RQ5架构选择(CNN 与 Transformer)在多种退化类型下的鲁棒性表现有何差异?
主要发现
- 基于 Transformer 的模型在退化鲁棒性方面优于基于 CNN 的模型,尤其在时间退化(如数据包丢失和帧率降低)下表现更优。
- 对时间退化的鲁棒性随模型泛化能力增强而提升,表明能够捕捉长程时间依赖的模型更具韧性。
- 模型鲁棒性与计算成本和模型容量正相关——高容量模型表现出更好的 mPC 分数,这与追求模型效率的趋势相悖。
- 在退化数据上训练会降低模型在干净数据上的性能:12 个模型中有 10 个在单一退化类型(严重等级 3)上训练的模型,其干净准确率低于在干净数据上训练的基线模型。
- 在单一退化类型上训练的模型在未见退化类型上的泛化能力差:12 个模型中有 9 个在未见退化上的 mPC 低于干净数据训练的基线模型。
- 在图像分类中有效的鲁棒性干预措施(如噪声增强)无法迁移到视频任务,反而会损害视频分类中的泛化能力和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。