Skip to main content
QUICK REVIEW

[論文レビュー] Student Classroom Behavior Detection based on Improved YOLOv7

Fan Yang|arXiv (Cornell University)|Jun 6, 2023
Video Analysis and Summarization被引用数 6
ひとこと要約

本稿では、混雑した・隠蔽された状況下でも高い精度を発揮するように最適化されたYOLOv7の改良モデルを提案する。Bi-Level Routing Attention(BRA)とWise-IoU損失を統合することで、特に手を挙げる、読書する、書いているという行動を検出する際の精度が向上した。新たに構築されたSCB-Dataset(4,200枚の画像、18,400件のアノテーション)を用いて、mAP@0.5が79%に達し、ベースラインのYOLOv7比で1.8%の向上を達成した。

ABSTRACT

Accurately detecting student behavior in classroom videos can aid in analyzing their classroom performance and improving teaching effectiveness. However, the current accuracy rate in behavior detection is low. To address this challenge, we propose the Student Classroom Behavior Detection method, based on improved YOLOv7. First, we created the Student Classroom Behavior dataset (SCB-Dataset), which includes 18.4k labels and 4.2k images, covering three behaviors: hand raising, reading, and writing. To improve detection accuracy in crowded scenes, we integrated the biformer attention module and Wise-IoU into the YOLOv7 network. Finally, experiments were conducted on the SCB-Dataset, and the model achieved an mAP@0.5 of 79%, resulting in a 1.8% improvement over previous results. The SCB-Dataset and code are available for download at: https://github.com/Whiffe/SCB-dataset.

研究の動機と目的

  • 混雑または隠蔽状態にある教室における学生行動認識の検出精度が低い問題に対処すること。
  • 手を挙げる、読書する、書いているといった行動に焦点を当てた、教室行動検出のための専用データセットの開発。
  • 注意メカニズムと新規損失関数を用いてYOLOv7の性能を向上させ、一般化性能の向上と誤検出の低減を図ること。
  • 教育改善や学力分析を支援するための、リアルタイムで実用的かつ高精度な教室監視ソリューションの提供。

提案手法

  • 手を挙げる、読書する、書いているの3つの行動を対象に、合計4,200枚の画像と18,400件のアノテーションを含むSCB-Datasetを構築した。
  • 複雑なシーンにおける特徴表現の向上を目的に、YOLOv7にBi-Level Routing Attention(BRA)モジュールを統合し、クエリに応じた動的スパarsityを実現した。
  • 標準的なIoU損失をWise-IoUに置き換えることで、YOLOv7+Wise-IoUを提案。Wise-IoUはアノテーションボックスの品質に応じて勾配ゲインを動的に調整することで、収束性と精度の向上を図る。
  • 主な評価指標としてmAP@0.5およびmAP@0.5:0.95を用い、SCB-Dataset上でモデルを訓練・評価した。また、各モジュールの寄与度を特定するためのアブレーションスタディを実施した。
  • Grad-CAMを用いた可視化により、推論時におけるモデルの注目領域(例:手、本)を検証し、注目メカニズムの妥当性を確認した。
  • BRAとWise-IoUを統合したハイブリッドモデル(YOLOv7+BRA+Wise-IoU)を構築し、正確性と重複検出の低減を両立した。

実験結果

リサーチクエスチョン

  • RQ1一般的な物体検出ベンチマークとは異なり、教室行動検出に特化したカスタムデータセットを用いることで、モデルの性能が向上するか?
  • RQ2YOLOv7にBi-Level Routing Attentionを統合することで、隠蔽状態にある混雑した教室シーンにおける検出精度が向上するか?
  • RQ3低品質で不均一に分布するデータセットにおいて、Wise-IoU損失が標準的なIoUベースの損失関数を上回るのか、mAPおよび学習収束性の観点から検証する。
  • RQ4BRAおよびWise-IoUの個別的および統合的効果が、学生行動検出における精度、再現率、mAPにどのように影響を与えるか?

主な発見

  • 提案されたYOLOv7+Wise-IoU v3は、mAP@0.5が79.0%に達し、元のYOLOv7比で1.8%の向上を示した。
  • YOLOv7+BRAは、手を挙げる行動で3.5%、読書で7.0%、書いているで6.9%の精度向上を達成した。
  • Wise-IoU v3はv1およびv2の各バージョンを上回り、全体のmAP@0.5:0.95が60.3%という最高値を記録した。
  • YOLOv7+Wise-IoUモデルは、ボクシングボックス損失が低く、収束が速く、学習効率が向上した。
  • Grad-CAMの可視化により、YOLOv7+Wise-IoUおよびYOLOv7+BRAが、関連する身体部位(例:手、本)に適切に注目していることが確認された。
  • ハイブリッドモデルであるYOLOv7+BRA+Wise-IoUは、重複検出を低減しながらも高い精度を維持し、YOLOv7+Wise-IoUを上回る局所化の一貫性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。