Skip to main content
QUICK REVIEW

[논문 리뷰] VLEngagement: A Dataset of Scientific Video Lectures for Evaluating Population-based Engagement

Sahan Bulathwela, María Pérez‐Ortiz|arXiv (Cornell University)|2020. 11. 02.
Wikis in Education and Collaboration참고 문헌 40인용 수 9
한 줄 요약

이 논문은 VideoLectures.NET에서 확보한 4,000개 이상의 과학 영상 강의에서 유저 참여도 지표와 함께 내용 기반, 위키백과 기반, 영상 고유의 특징을 포함하는 대규모 공개 데이터셋인 VLEngagement를 소개한다. 이는 참여도 예측 및 랭킹을 위한 새로운 과제를 통해 인구 기반의 참여도 예측을 가능하게 하며, 앙상블 학습을 활용한 베이스라인 모델이 뛰어난 성능을 보이며, 교육 분야의 스케일러블 품질 보증 및 추천 시스템을 지원한다.

ABSTRACT

With the emergence of e-learning and personalised education, the production and distribution of digital educational resources have boomed. Video lectures have now become one of the primary modalities to impart knowledge to masses in the current digital age. The rapid creation of video lecture content challenges the currently established human-centred moderation and quality assurance pipeline, demanding for more efficient, scalable and automatic solutions for managing learning resources. Although a few datasets related to engagement with educational videos exist, there is still an important need for data and research aimed at understanding learner engagement with scientific video lectures. This paper introduces VLEngagement, a novel dataset that consists of content-based and video-specific features extracted from publicly available scientific video lectures and several metrics related to user engagement. We introduce several novel tasks related to predicting and understanding context-agnostic engagement in video lectures, providing preliminary baselines. This is the largest and most diverse publicly available dataset to our knowledge that deals with such tasks. The extraction of Wikipedia topic-based features also allows associating more sophisticated Wikipedia based features to the dataset to improve the performance in these tasks. The dataset, helper tools and example code snippets are available publicly at https://github.com/sahanbull/context-agnostic-engagement

연구 동기 및 목표

  • 과학 영상 강의에서 맥락에 무관한 참여도 평가를 위한 공개 데이터셋 부족 문제를 해결하기 위해.
  • 사용자 피드백이 제공되기 이전에 참여도 잠재력을 예측할 수 있도록 하여 교육 분야의 스케일러블 품질 보증 및 추천 시스템을 지원하기 위해.
  • 신규 사용자 및 신규 콘텐츠에 대한 추천 시스템의 쿨스타트 문제를 해결하기 위한 기반을 제공하기 위해.
  • 과학 교육 영상에서 참여도를 이끄는 요인을 이해하기 위해 다중모odal 특징(텍스트, 시각, 위키백과 기반)에 대한 연구를 가능하게 하기 위해.
  • 오픈 교육 자원에서의 실질적 데이터를 활용하여 인구 기반 참여도 예측 및 랭킹에 대한 벤치마크를 설정하기 위해.

제안 방법

  • 4,000개 이상의 동료 심사를 통과한 과학 영상 강의를 VideoLectures.NET에서 확보하여 데이터셋을 구축하였으며, 다양한 지식 분야와 언어를 포함한다.
  • 강의 원고에서 자연어 처리 기법을 활용해 문법적, 의미적, 어휘적 패턴을 포함한 내용 기반 특징을 추출하였다.
  • 엔티티 연결을 통해 위키백과 주제 기반 특징을 유도하여 구조화된 지식과 연계함으로써 모델링 성능을 향상시켰다.
  • 음성-시각적 특징과 프resetation 슬라이드 패턴을 포함한 영상 고유의 특징을 추출하여 다중모달 참여도 신호를 포착하였다.
  • 조회수, 좋아요, 공유 수와 같은 공개 상호작용 지표를 활용해 맥락에 무관한 참여도 레이블을 수집하였다.
  • 주요 과제로 참여도 예측 및 랭킹을 정의하였으며, 앙상블 학습 모델을 기반으로 한 접근 방식을 사용하였다.

실험 결과

연구 질문

  • RQ1특히 위키백과 기반 및 내용 기반 특징 중 과학 영상 강의의 인구 수준 참여도를 가장 잘 예측하는 특징는 무엇인가?
  • RQ2앙성스 학습 모델은 다중모달 특징에서 맥락에 무관한 참여도를 예측하는 데 얼마나 효과적인가?
  • RQ3참여도 예측 모델은 교육 추천 시스템의 쿨스타트 문제를 어느 정도 완화할 수 있는가?
  • RQ4다양한 모odal(텍스트, 음성, 영상, 슬라이드)은 과학 콘텐츠의 참여도 예측에 어떻게 기여하는가?
  • RQ5이 데이터셋은 다양한 교육 콘텐츠 모달 간의 다중과제 학습 및 전이 학습을 지원할 수 있는가?

주요 결과

  • VLEngagement 데이터셋은 다양한 콘텐츠, 언어, 지식 영역을 포함한 4,000개 이상의 과학 영상 강의를 포함하고 있어, 이 목적을 위해 가장 큰 공개 데이터셋이다.
  • 앙성스 학습 모델은 참여도 예측 및 랭킹 과제에서 뛰어난 성능을 보이며, 자동 참여도 추정의 가능성을 입증하였다.
  • 위키백과 기반 엔티티 연결 통합이 특징 표현을 크게 향상시켜 모델 일반화 및 해석 가능성 향상에 기여하였다.
  • 이 데이터셋은 맥락에 무관한 참여도의 효과적 모델링을 가능하게 하여, e-러닝 분야의 스케일러블 품질 보증 및 추천 파이프라인을 지원한다.
  • 초기 결과에서는 다중모달 특징(텍스트, 시각, 음성-시각)이 단일모달 접근 방식을 초월해 참여도 예측 성능을 향상시킴을 보였다.
  • 이 데이터셋은 도구 및 코드와 함께 공개되어 재현 가능성을 보장하며, 향후 교육 추천 시스템 분야의 연구를 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.