Skip to main content
QUICK REVIEW

[论文解读] Student Classroom Behavior Detection based on Improved YOLOv7

Fan Yang|arXiv (Cornell University)|Jun 6, 2023
Video Analysis and Summarization被引用 6
一句话总结

本文提出了一种改进的 YOLOv7 模型用于学生课堂行为检测,通过集成 Bi-Level Routing Attention (BRA) 和 Wise-IoU 损失,在人群密集、遮挡严重的场景中提升了检测精度。该方法在新构建的 SCB-Dataset 上实现了 79% 的 mAP@0.5,较基线 YOLOv7 提升 1.8%,该数据集包含 4,200 张图像和 18,400 个标注,涵盖举手、阅读和书写三种行为。

ABSTRACT

Accurately detecting student behavior in classroom videos can aid in analyzing their classroom performance and improving teaching effectiveness. However, the current accuracy rate in behavior detection is low. To address this challenge, we propose the Student Classroom Behavior Detection method, based on improved YOLOv7. First, we created the Student Classroom Behavior dataset (SCB-Dataset), which includes 18.4k labels and 4.2k images, covering three behaviors: hand raising, reading, and writing. To improve detection accuracy in crowded scenes, we integrated the biformer attention module and Wise-IoU into the YOLOv7 network. Finally, experiments were conducted on the SCB-Dataset, and the model achieved an mAP@0.5 of 79%, resulting in a 1.8% improvement over previous results. The SCB-Dataset and code are available for download at: https://github.com/Whiffe/SCB-dataset.

研究动机与目标

  • 为解决学生课堂行为识别中在人群密集或遮挡场景下的低检测精度问题。
  • 构建一个专注于举手、阅读和书写动作的专用课堂行为检测数据集。
  • 通过注意力机制和新型损失函数提升 YOLOv7 的性能,以增强泛化能力并减少误检。
  • 提供一种实用且高精度的实时课堂监控解决方案,以支持教学改进和学生表现分析。

提出的方法

  • 构建了 SCB-Dataset,包含 4,200 张图像和 18,400 个标注,涵盖三种行为:举手、阅读和书写。
  • 将 Bi-Level Routing Attention (BRA) 模块集成到 YOLOv7 中,实现动态、查询感知的稀疏性,提升复杂场景下的特征表示能力。
  • 提出 YOLOv7+Wise-IoU,通过用 Wise-IoU 替代标准 IoU 损失,根据候选框质量动态调整梯度增益,从而提升收敛速度和检测精度。
  • 使用 mAP@0.5 和 mAP@0.5:0.95 作为主要评估指标,在 SCB-Dataset 上训练并评估模型,同时通过消融实验隔离各组件的贡献。
  • 采用 Grad-CAM 可视化技术解释注意力机制,验证模型在推理过程中对相关身体部位(如手、书本)的关注程度。
  • 将 BRA 和 Wise-IoU 组合应用于混合模型(YOLOv7+BRA+Wise-IoU),以平衡检测精度与重叠检测的减少。

实验结果

研究问题

  • RQ1与通用目标检测基准相比,定制化的课堂行为检测数据集是否能提升模型性能?
  • RQ2将 Bi-Level Routing Attention 集成到 YOLOv7 中,是否能提升在人群密集且存在遮挡的课堂场景中的检测精度?
  • RQ3在低质量、分布不均的数据集上,Wise-IoU 损失是否在 mAP 和训练收敛性方面优于标准 IoU 基础损失?
  • RQ4BRA 和 Wise-IoU 的单独及组合使用对检测学生行为的精确率、召回率和 mAP 有何影响?

主要发现

  • 所提出的 YOLOv7+Wise-IoU v3 在 mAP@0.5 上达到最高值 79.0%,较原始 YOLOv7 提升 1.8%。
  • YOLOv7+BRA 相较于基线 YOLOv7,举手行为的精确率提升 3.5%,阅读行为提升 7.0%,书写行为提升 6.9%。
  • Wise-IoU v3 在性能上优于 v1 和 v2 版本,实现了最佳整体 mAP@0.5:0.95 值 60.3%。
  • YOLOv7+Wise-IoU 模型表现出更快的收敛速度和更低的边界框损失,表明训练效率更高。
  • Grad-CAM 可视化结果表明,YOLOv7+Wise-IoU 和 YOLOv7+BRA 更好地聚焦于相关区域(如手、书本),提升了检测的可靠性。
  • 混合模型 YOLOv7+BRA+Wise-IoU 在保持高精确率的同时减少了重叠检测,其定位一致性优于 YOLOv7+Wise-IoU。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。