Skip to main content
QUICK REVIEW

[论文解读] CVB: A Video Dataset of Cattle Visual Behaviors

Ali Zia, Renuka Sharma|arXiv (Cornell University)|May 26, 2023
Animal Behavior and Welfare Studies被引用 5
一句话总结

本论文介绍了CVB,一个大规模视频数据集,包含502段15秒长的自然光照下放牧牛只的视频片段,标注了11种视觉上可感知的行为。通过使用预训练的YOLOv7和Botsort模型进行初始检测与跟踪,随后在CVAT中由专家验证标注,作者将标注工作量减少了71%。该数据集使基于SlowFast模型能够实现对常见行为(如采食,准确率达73.96%)和静卧(准确率达58%)的精确定位与识别,尽管存在类别不平衡,对罕见行为也取得了有前景的结果。

ABSTRACT

Existing image/video datasets for cattle behavior recognition are mostly small, lack well-defined labels, or are collected in unrealistic controlled environments. This limits the utility of machine learning (ML) models learned from them. Therefore, we introduce a new dataset, called Cattle Visual Behaviors (CVB), that consists of 502 video clips, each fifteen seconds long, captured in natural lighting conditions, and annotated with eleven visually perceptible behaviors of grazing cattle. We use the Computer Vision Annotation Tool (CVAT) to collect our annotations. To make the procedure more efficient, we perform an initial detection and tracking of cattle in the videos using appropriate pre-trained models. The results are corrected by domain experts along with cattle behavior labeling in CVAT. The pre-hoc detection and tracking step significantly reduces the manual annotation time and effort. Moreover, we convert CVB to the atomic visual action (AVA) format and train and evaluate the popular SlowFast action recognition model on it. The associated preliminary results confirm that we can localize the cattle and recognize their frequently occurring behaviors with confidence. By creating and sharing CVB, our aim is to develop improved models capable of recognizing all important behaviors accurately and to assist other researchers and practitioners in developing and evaluating new ML models for cattle behavior classification using video data.

研究动机与目标

  • 解决在自然环境中缺乏大规模、真实且标注详尽的视频数据集以支持牛只行为识别的问题。
  • 通过利用预训练的目标检测与跟踪模型(YOLOv7和Botsort)在专家标注前减少人工标注工作量。
  • 构建一个支持鲁棒机器学习模型的数据集,使其能够在真实世界条件下识别频繁和罕见的牛只行为。
  • 通过视频数据支持新型深度学习模型在动物行为分类中的开发与评估。
  • 通过准确的行为识别,支持改善牲畜管理、福利监测和环境可持续性。

提出的方法

  • 使用安装在牧场四个角落的高分辨率摄像机,采集了8头安格斯牛在自然光照下的502段15秒视频片段。
  • 通过将视频划分为固定时间片段,并应用YOLOv7进行目标检测,Botsort进行多目标跟踪,对视频进行预处理。
  • 使用计算机视觉标注工具(CVAT)对检测结果进行人工校正并标注行为,由领域专家确保标注准确性。
  • 将最终标注转换为原子视觉动作(AVA)格式,以支持可处理多主体及交互行为的动作识别模型。
  • 在AVA格式化的CVB数据集上,采用80:20的训练-测试划分,对SlowFast动作识别模型进行训练与评估。
  • 采用交并比(IoU)阈值(>50%)评估定位准确性,并报告行为预测的置信度分数。

实验结果

研究问题

  • RQ1在自然光照下具有详细行为标注的大规模视频数据集,是否能够提升机器学习模型在行为识别任务中的性能?
  • RQ2预训练的目标检测与跟踪模型在多大程度上能够减少牛只行为数据集中的人工标注负担?
  • RQ3在具有长尾类别分布的真实牛只行为数据集上,最先进动作识别模型(SlowFast)的性能表现如何?
  • RQ4在遮挡和光照变化等复杂条件下,基于CVB训练的模型是否能够成功识别频繁行为(如采食)和罕见行为(如梳理、奔跑)?
  • RQ5AVA格式在表示牛只视频数据中多主体行为及动作转换方面是否有效?

主要发现

  • CVB数据集包含502段视频片段,每段15秒,共225,900帧标注,136,598个经校正的边界框,表明仅有29%的初始检测需要人工校正。
  • 采食是最频繁的行为(占39%的时间),其次是静卧(15%)、站立静息(12%)和隐藏(10%),其余行为均低于5%的时间,反映出长尾分布特征。
  • 当定位IoU超过50%时,SlowFast模型在采食行为上的测试准确率达到73.96%,在静卧行为上达到58%,对应的平均置信度分数分别为89%和82%。
  • 尽管训练数据有限,模型在罕见行为(如轻度攻击、梳理)上仍表现出合理性能,显示出向低资源类别泛化的潜力。
  • 模型在存在遮挡和多头牛只的复杂场景中成功实现了行为的定位与识别,包括多只动物部分被遮挡的情况(图2b)。
  • 使用预训练检测与跟踪模型显著减少了标注时间和工作量,使大规模数据集的构建与扩展成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。