Skip to main content
QUICK REVIEW

[论文解读] Vision-based Behavioral Recognition of Novelty Preference in Pigs

Aniket Shirke, Rebecca K. Golden|arXiv (Cornell University)|Jun 23, 2021
Human Pose and Action Recognition参考文献 10被引用 4
一句话总结

本文介绍了猪新颖性偏好行为(PNPB)数据集,这是一个用于使用深度学习进行猪行为自动识别的完全标注视频集合。该研究在动作识别和NOR度量预测任务上评估了LRCN、C3D和TSM模型,分别实现了93%的准确率和96%的平均精度均值(mAP),但针对快速猪只运动导致的细粒度度量(如探索次数和延迟)回归仍存在挑战。

ABSTRACT

Behavioral scoring of research data is crucial for extracting domain-specific metrics but is bottlenecked on the ability to analyze enormous volumes of information using human labor. Deep learning is widely viewed as a key advancement to relieve this bottleneck. We identify one such domain, where deep learning can be leveraged to alleviate the process of manual scoring. Novelty preference paradigms have been widely used to study recognition memory in pigs, but analysis of these videos requires human intervention. We introduce a subset of such videos in the form of the 'Pig Novelty Preference Behavior' (PNPB) dataset that is fully annotated with pig actions and keypoints. In order to demonstrate the application of state-of-the-art action recognition models on this dataset, we compare LRCN, C3D, and TSM on the basis of various analytical metrics and discuss common pitfalls of the models. Our methods achieve an accuracy of 93% and a mean Average Precision of 96% in estimating piglet behavior. We open-source our code and annotated dataset at https://github.com/AIFARMS/NOR-behavior-recognition

研究动机与目标

  • 通过开发一种基于深度学习的自动化解决方案,解决猪行为研究中人工视频标注的瓶颈问题。
  • 创建一个完全标注的数据集——PNPB,包含用于新颖性偏好测试的猪只动作和关键点。
  • 在猪只视频数据上评估最先进动作识别模型(LRCN、C3D、TSM)在片段级别和视频级别上的性能。
  • 评估模型在预测领域特定NOR度量(如识别指数、探索持续时间)方面是否能达到人类水平的准确性。
  • 识别当前模型在应用于快速动物行为时的技术局限性,特别是涉及时间精度和短时动作的度量。

提出的方法

  • PNPB数据集包含5.5分钟的猪仔在新颖性偏好实验场中的视频,标注了动作(如探索)和2D关键点。
  • 使用30帧片段对三种深度学习模型——LRCN、C3D和TSM——进行训练和评估,用于片段级别动作识别。
  • LRCN使用ResNet-18主干网络进行空间特征提取,随后通过LSTM进行时间建模。
  • C3D在视频片段上使用3D卷积来学习时空特征,并在Sports1M预训练权重上进行微调。
  • TSM使用ResNet-18主干网络,并引入时间移位模块(Temporal Shift Module),在无需RNN的情况下高效建模时间动态。
  • 通过连续动作识别指标(TP、TN、O、U、F、M、I、D)评估视频级别性能,以分析边界对齐情况和错误类型。

实验结果

研究问题

  • RQ1最先进动作识别模型能否在新颖性偏好任务中对猪只行为分类达到人类水平的准确率?
  • RQ2这些模型在预测领域特定NOR度量(如识别指数、探索持续时间、延迟)方面的能力如何?
  • RQ3当应用于快速、短时长的猪只行为时,深度学习模型的主要失效模式是什么?
  • RQ4计算效率和模型架构(如RNN vs. 3D-CNN vs. TSM)如何影响性能和推理速度?
  • RQ5为何尽管片段级别准确率很高,模型在回归探索次数和延迟等度量时仍不准确?

主要发现

  • 模型在短片段视频上的猪只行为分类任务中实现了93%的准确率和96%的平均精度均值(mAP)。
  • TSM模型在计算效率与性能之间提供了最佳平衡,CPU上达到14.2 FPS,计算量为2.1 GMACs。
  • 连续动作识别表现出较高的真正例和真负例率(>90%),但在约3%的时间内出现严重错误(插入或删除)。
  • 模型对CD(总探索持续时间)和RI(识别指数)的预测具有较高的决定系数(R²分别为0.99和0.86),表明回归性能优异。
  • 模型对探索次数(N)的预测存在低估,且在LF和LL度量上表现不佳,R²分别为0.58、0.42和-0.26。
  • 主要挑战在于检测持续时间不足一秒的短暂、高速互动,而这些互动对NOR度量的准确计算至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。