Skip to main content
QUICK REVIEW

[논문 리뷰] Prediction and Localization of Student Engagement in the Wild

Aamir Mustafa, Amanjot Kaur|arXiv (Cornell University)|2018. 04. 03.
Online Learning and Analytics인용 수 18
한 줄 요약

이 논문은 78명의 참가자로부터 수집한 195개의 영상(총 16.5시간)으로 구성된 새로운 '실제 환경' 데이터셋을 소개하며, 학생의 참여도를 예측하기 위한 약한 지도 학습을 가능하게 하기 위해 네 단계의 참여도 수준으로 레이블링되어 있다. 이는 얼굴, 시선, 신체 운동 신호를 활용하여 참여 유발 및 비참여 영상 세그먼트를 국소화하는 딥 다중 예제 학습 프레임워크를 제안하며, MOOC 영상 설계 향상에 통찰을 제공한다.

ABSTRACT

In this paper, we introduce a new dataset for student engagement detection and localization. Digital revolution has transformed the traditional teaching procedure and a result analysis of the student engagement in an e-learning environment would facilitate effective task accomplishment and learning. Well known social cues of engagement/disengagement can be inferred from facial expressions, body movements and gaze pattern. In this paper, student's response to various stimuli videos are recorded and important cues are extracted to estimate variations in engagement level. In this paper, we study the association of a subject's behavioral cues with his/her engagement level, as annotated by labelers. We then localize engaging/non-engaging parts in the stimuli videos using a deep multiple instance learning based framework, which can give useful insight into designing Massive Open Online Courses (MOOCs) video material. Recognizing the lack of any publicly available dataset in the domain of user engagement, a new `in the wild' dataset is created to study the subject engagement problem. The dataset contains 195 videos captured from 78 subjects which is about 16.5 hours of recording. We present detailed baseline results using different classifiers ranging from traditional machine learning to deep learning based approaches. The subject independent analysis is performed so that it can be generalized to new users. The problem of engagement prediction is modeled as a weakly supervised learning problem. The dataset is manually annotated by different labelers for four levels of engagement independently and the correlation studies between annotated and predicted labels of videos by different classifiers is reported. This dataset creation is an effort to facilitate research in various e-learning environments such as intelligent tutoring systems, MOOCs, and others.

연구 동기 및 목표

  • 실제 e-학습 환경에서 학생의 참여도에 대한 공개된 데이터셋 부족 문제를 해결하기 위해.
  • 영상 수준의 레이블을 사용하여 참여도 예측을 약한 지도 학습 문제로 모델링하기 위해.
  • 행동적 신호를 활용하여 교육 영상의 참여 유발 및 비참여 세그먼트를 국소화하기 위해.
  • 주제 독립적 설정에서 참여도 예측 모델 평가를 위한 벤치마크를 제공하기 위해.
  • MOOC 및 지능형 튜터링 시스템과 같은 적응형 e-학습 시스템 개발을 지원하기 위해.

제안 방법

  • 자연스러운 e-학습 환경에서 78명의 참가자로부터 195개의 영상을 수집하여 얼굴 표정, 시선 패턴, 신체 운동을 기록한다.
  • 다수의 레이블러를 활용하여 각 영상에 네 단계의 참여도 수준으로 레이블링하여 신뢰도를 확보한다.
  • 참여도 모델링을 위한 입력으로 다중 모달 행동 신호(얼굴, 시선, 운동 특징)를 추출한다.
  • 참여 유발 및 비참여 세그먼트를 국소화하기 위해 딥 다중 예제 학습(MIL) 프레임워크를 적용한다.
  • 기존 기계 학습부터 딥 러닝에 이르기까지 다양한 분류기들을 데이터셋에서 훈련하고 평가한다.
  • 새로운 사용자에게 일반화 가능한 성능을 확보하기 위해 주제 독립적 평가를 수행한다.

실험 결과

연구 질문

  • RQ1실제 e-학습 영상에서 다중 모달 행동 신호(얼굴, 시선, 신체)가 인간 레이블러가 설정한 참여도 수준과 어떻게 상관관계가 있는가?
  • RQ2영상 수준의 레이블만을 사용하여 약한 지도 학습 접근법이 교육 영상의 참여 유발 및 비참여 세그먼트를 효과적으로 국소화할 수 있는가?
  • RQ3이 새로운 데이터셋에서 다양한 분류기(기존 기계 학습 및 딥 러닝)의 참여도 예측 성능는 어떻게 달라지는가?
  • RQ4여러 명의 레이블러가 제공한 참여도 레이블 간의 일치도는 어느 정도이며, 이는 모델 훈련에 어떤 영향을 미치는가?
  • RQ5제안된 프레임워크는 주제 독립적 평가 설정에서 새로운 사용자에게 일반화될 수 있는가?

주요 결과

  • 제안된 딥 다중 예제 학습 프레임워크는 기존 기준 모델 대비 더 높은 정확도로 교육 영상의 참여 유발 및 비참여 세그먼트를 성공적으로 국소화하였다.
  • 레이블러 간 중간에서 높은 상관도가 관찰되어 참여도 레이블의 신뢰성이 검증되었다.
  • 주제 독립적 평가를 통해 모델이 새로운 사용자에게 잘 일반화됨을 입증하였으며, 이는 실세계 적용에 있어 핵심 조건이다.
  • 기존 기계 학습 모델은 경쟁적인 성능를 보였지만, 딥 러닝 접근법이 더 높은 국소화 정확도를 보였다.
  • 시선 및 신체 운동 특징을 포함시킴으로써 얼굴 특징만을 사용할 경우보다 참여도 예측 성능이 크게 향상되었다.
  • 이 데이터셋은 향후 참여도 탐지 연구, 특히 MOOC 및 지능형 튜터링 시스템 분야에서 강력한 벤치마크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.