Skip to main content
QUICK REVIEW

[논문 리뷰] Student Classroom Behavior Detection based on Improved YOLOv7

Fan Yang|arXiv (Cornell University)|2023. 06. 06.
Video Analysis and Summarization인용 수 6
한 줄 요약

이 논문은 복잡하고 가림이 있는 장면에서 학생 수업 행동 인식의 정확도를 향상시키기 위해 Bi-Level Routing Attention (BRA)와 Wise-IoU 손실을 통합한 개선된 YOLOv7 모델을 제안한다. 새로 제작한 SCB-Dataset(4,200장의 이미지와 18,400개의 애너테이션)을 사용하여 손을 들기, 읽기, 쓰기 행동을 탐지하였으며, mAP@0.5는 79%를 기록하여 기준 YOLOv7 대비 1.8% 향상되었다.

ABSTRACT

Accurately detecting student behavior in classroom videos can aid in analyzing their classroom performance and improving teaching effectiveness. However, the current accuracy rate in behavior detection is low. To address this challenge, we propose the Student Classroom Behavior Detection method, based on improved YOLOv7. First, we created the Student Classroom Behavior dataset (SCB-Dataset), which includes 18.4k labels and 4.2k images, covering three behaviors: hand raising, reading, and writing. To improve detection accuracy in crowded scenes, we integrated the biformer attention module and Wise-IoU into the YOLOv7 network. Finally, experiments were conducted on the SCB-Dataset, and the model achieved an mAP@0.5 of 79%, resulting in a 1.8% improvement over previous results. The SCB-Dataset and code are available for download at: https://github.com/Whiffe/SCB-dataset.

연구 동기 및 목표

  • 복잡하거나 가림이 있는 장면에서 학생 수업 행동 인식의 낮은 정확도 문제를 해결하기 위해.
  • 손을 들기, 읽기, 쓰기 행동에 중점을 두고 수업 행동 탐지 전용 데이터셋을 개발하기 위해.
  • 주의 메커니즘과 새로운 손실 함수를 통해 YOLOv7의 성능을 향상시켜 일반화 능력을 높이고 오진 탐지 수를 줄이기 위해.
  • 실시간 수업 모니터링을 위한 실용적이고 정확한 솔루션을 제공하여 교육 향상과 학생 성취도 분석을 지원하기 위해.

제안 방법

  • 손을 들기, 읽기, 쓰기 행동을 위한 3가지 행동에 대해 총 4,200장의 이미지와 18,400개의 애너테이션을 포함한 SCB-Dataset을 구축하였다.
  • 복잡한 장면에서 특징 표현을 향상시키기 위해 YOLOv7에 Bi-Level Routing Attention (BRA) 모듈을 통합하여 동적이고 쿼리에 의존하는 희소성 기능을 구현하였다.
  • 기본 IoU 손실을 Wise-IoU로 대체하여 YOLOv7+Wise-IoU를 제안하였으며, 이는 앵커 박스의 품질에 따라 기울기의 영향을 동적으로 조정함으로써 수렴성과 정확도를 향상시킨다.
  • 주로 mAP@0.5와 mAP@0.5:0.95를 사용하여 SCB-Dataset에서 모델을 훈련하고 평가하였으며, 구성 요소 기여도를 분리하기 위해 분석 실험을 실시하였다.
  • 경과 기반 시각화(Grad-CAM)를 통해 주의 메커니즘을 해석하고 추론 중 모델이 관련 신체 부위(예: 손, 책)에 집중하는지 검증하였다.
  • 정밀도와 탐지 겹침 감소를 균형 있게 확보하기 위해 BRA와 Wise-IoU를 융합한 하이브리드 모델(YOLOv7+BRA+Wise-IoU)을 구성하였다.

실험 결과

연구 질문

  • RQ1일반적인 객체 탐지 벤치마크와 비교할 때, 수업 행동 탐지 전용 맞춤형 데이터셋이 모델 성능 향상에 기여하는가?
  • RQ2YOLOv7에 Bi-Level Routing Attention을 통합하면, 가림이 많고 혼잡한 수업 장면에서 탐지 정확도가 향상되는가?
  • RQ3저품질이며 균형 잡히지 않은 데이터셋에서 Wise-IoU 손실이 기존 IoU 기반 손실보다 mAP와 수렴성 측면에서 뛰어나게 성능을 내는가?
  • RQ4BRA와 Wise-IoU의 개별 및 융합된 구성 요소가 학생 행동 탐지의 정밀도, 재현율, mAP에 어떤 영향을 미치는가?

주요 결과

  • 제안된 YOLOv7+Wise-IoU v3가 mAP@0.5 최고 79.0%를 기록하여 원본 YOLOv7 대비 1.8% 향상되었다.
  • YOLOv7+BRA는 기준 YOLOv7 대비 손을 들기 행동에서 3.5% 정밀도 향상, 읽기 행동에서 7.0%, 쓰기 행동에서 6.9% 향상되었다.
  • Wise-IoU v3는 v1과 v2 버전을 모두 압도하여 전체 mAP@0.5:0.95 최고 60.3%를 기록하였다.
  • YOLOv7+Wise-IoU 모델은 더 낮은 바운딩 박스 손실을 기록하며 더 빠른 수렴을 보였으며, 훈련 효율성이 향상됨을 확인하였다.
  • Grad-CAM 시각화 결과, YOLOv7+Wise-IoU와 YOLOv7+BRA가 관련 영역(예: 손, 책)에 더 잘 집중하고 있음을 확인하여 탐지 신뢰도가 향상됨을 입증하였다.
  • 하이브리드 모델인 YOLOv7+BRA+Wise-IoU는 겹치는 탐지 수를 감소시키면서도 높은 정밀도를 유지하여 YOLOv7+Wise-IoU보다 국소화 일致성 측면에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.