Skip to main content
QUICK REVIEW

[论文解读] ARID: A New Dataset for Recognizing Action in the Dark

Yuecong Xu, Jianfei Yang|arXiv (Cornell University)|Jun 6, 2020
Video Surveillance and Tracking Methods被引用 10
一句话总结

本文提出了ARID,这是首个针对低光照条件下动作识别的大规模数据集,包含在真实黑暗环境中拍摄的11种动作类别共3,780段视频剪辑。研究发现,当前的动作识别模型和帧增强技术在真实暗视频上表现不佳,通常由于对比度低以及模型错误地将注意力集中在背景上,凸显了合成暗数据的不足,强调了开发领域专用模型的必要性。

ABSTRACT

The task of action recognition in dark videos is useful in various scenarios, e.g., night surveillance and self-driving at night. Though progress has been made in the action recognition task for videos in normal illumination, few have studied action recognition in the dark. This is partly due to the lack of sufficient datasets for such a task. In this paper, we explored the task of action recognition in dark videos. We bridge the gap of the lack of data for this task by collecting a new dataset: the Action Recognition in the Dark (ARID) dataset. It consists of over 3,780 video clips with 11 action categories. To the best of our knowledge, it is the first dataset focused on human actions in dark videos. To gain further understandings of our ARID dataset, we analyze the ARID dataset in detail and exhibited its necessity over synthetic dark videos. Additionally, we benchmarked the performance of several current action recognition models on our dataset and explored potential methods for increasing their performances. Our results show that current action recognition models and frame enhancement methods may not be effective solutions for the task of action recognition in dark videos.

研究动机与目标

  • 解决低光照条件下真实世界数据集缺乏的问题。
  • 展示与真实暗视频相比,合成暗视频的局限性。
  • 在真实暗视频数据上对现有动作识别模型进行基准测试,并识别性能瓶颈。
  • 评估帧增强方法及其在暗视频设置下对模型准确率的影响。
  • 为未来开发专为低光照动作识别设计的鲁棒模型提供指导。

提出的方法

  • ARID数据集从真实世界的黑暗环境(包括室内和室外夜间场景)中收集,包含11种动作类别和超过3,780段视频剪辑。
  • 通过统计和视觉分析,对比真实暗视频与合成暗视频,重点关注亮度、对比度和纹理特征。
  • 对ARID应用了五种帧增强方法——高斯图像对比度(GIC)、直方图均衡化(HE)、LIME、BIMEF和KinD,以评估其对模型性能的影响。
  • 在原始和增强后的ARID数据上评估了多种最先进动作识别模型,包括C3D和3D-ResNeXt-101。
  • 通过可视化类激活图(CAMs)分析模型注意力,识别对背景或伪影的错误聚焦。
  • 探索了领域自适应和模型微调策略,作为未来提升真实暗视频数据上性能的可能方向。

实验结果

研究问题

  • RQ1在视觉和统计特征方面,真实暗视频与合成暗视频有何不同?
  • RQ2现有的帧增强技术能否有效提升真实暗视频数据上的动作识别准确率?
  • RQ3为何即使经过帧增强,当前动作识别模型在暗视频数据上仍无法实现高准确率?
  • RQ4不同帧增强方法在低光照条件下对模型注意力和特征学习的影响程度如何?
  • RQ5在合成暗数据上训练的模型能否有效适应真实暗视频数据分布?

主要发现

  • 真实暗视频的对比度显著低于合成暗视频,这是合成方法无法复制的关键特征,凸显了使用真实数据集进行训练的必要性。
  • 如HE和LIME等帧增强方法在ARID上降低了动作识别准确率,表明某些增强技术可能引入伪影或类似对抗性效应。
  • BIMEF和KinD增强方法在部分模型上提升了准确率,表明并非所有增强技术在下游识别任务中都同样有效或安全。
  • C3D模型在暗视频中对动作主体的注意力较差,CAMs显示其广泛聚焦于背景区域,这与低准确率密切相关。
  • 3D-ResNeXt-101在ARID上的表现优于C3D,表明深层架构在结合适当增强方法时,可能更能应对低光照挑战。
  • 本研究揭示,当前模型在处理轮廓模糊的动作主体时难以聚焦,表明需要专门针对低光照动作识别设计的注意力机制或网络架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。