Skip to main content
QUICK REVIEW

[논문 리뷰] Neural network approach to classifying alarming student responses to online assessment

Christopher M. Ormerod, Amy E. Harris|arXiv (Cornell University)|2018. 09. 20.
Online Learning and Analytics참고 문헌 37인용 수 4
한 줄 요약

이 논문은 자살 위협, 폭력 또는 학대와 같은 경고 신호를 포함한 자유형 온라인 평가에서 일반적인 반응과 구분하여 경고 응답을 탐지하기 위해 양방향 스택형 LSTM 및 GRU 네트워크에 주목 메커니즘을 적용한 딥러닝 접근법을 제안한다. 최고의 성능을 보인 모델인 주목 메커니즘을 갖춘 양방향 스택형 LSTM는 10%의 검토 기준에서 98.7%의 경고 탐지율을 기록했으며, 위험도가 높은 경우의 조기에 개입을 크게 향상시켰다.

ABSTRACT

Automated scoring engines are increasingly being used to score the free-form text responses that students give to questions. Such engines are not designed to appropriately deal with responses that a human reader would find alarming such as those that indicate an intention to self-harm or harm others, responses that allude to drug abuse or sexual abuse or any response that would elicit concern for the student writing the response. Our neural network models have been designed to help identify these anomalous responses from a large collection of typical responses that students give. The responses identified by the neural network can be assessed for urgency, severity, and validity more quickly by a team of reviewers than otherwise possible. Given the anomalous nature of these types of responses, our goal is to maximize the chance of flagging these responses for review given the constraint that only a fixed percentage of responses can viably be assessed by a team of reviewers.

연구 동기 및 목표

  • 자유형 온라인 평가에서 자살 위협이나 폭력과 같은 경고 신호를 포함한 학생 응답을 자동으로 식별하는 시스템을 개발하는 것.
  • 기존의 자동 채점 시스템이 놓치는 맥락에 따라 변화하는 비정상적인 언어 패tern을 탐지하는 데 도전하는 것.
  • 고정된 비율의 응답만 수동으로 검토할 수 있는 제약 조건 하에 경고 탐지율을 최대화하는 것.
  • 고위험 교육 평가 환경에서 민감도와 임의의 경고(가짜 경고) 사이의 균형을 최적화하는 것.

제안 방법

  • 연구는 학생 응답의 순차적 텍스트 패턴을 모델링하기 위해 순환 신경망(RNN)을 사용하며, 특히 GRU와 LSTM을 활용한다.
  • 모델은 단어 임베딩을 사용하여 훈련되고, 1,000건의 경고 사례를 포함한 검증용 데이터셋을 5겹 교차검증으로 평가한다.
  • 스택형, 양방향, 주목 메커니즘을 통합한 아키텍처 변형을 통해 맥락 모델링 및 장거리 의존성 포착을 향상시킨다.
  • 초기화 파rameter 튜닝은 순환 유닛 크기, 스택 깊이, 양방향성, 주목 메커니즘 등을 중심으로 이루어지며, 경고 탐지 민감도를 극대화한다.
  • 성능는 다양한 검토 기준(1%에서 10%)에서 올바르게 경고로 표시된 경고 비율로 측정된다.
  • 앙상블 및 집계된 모델 출력을 통해 개별 모델을 초월한 탐지 성능 향상을 도모한다.

실험 결과

연구 질문

  • RQ1GRU, LSTM 또는 그 스택형, 양방향, 주목 메커니즘 통합 변형 중 어떤 RNN 아키텍처가 학생 응답에서 가장 높은 경고 탐지 성능을 내는가?
  • RQ2스택, 양방향성, 주목 메커니즘과 같은 아키텍처 구성 요소가 개별적으로 경고 탐지 민감도와 가짜 경고 비율에 어떤 영향을 미치는가?
  • RQ3딥러닝 모델이 높은 정밀도로 맥락적으로 미묘한 경고(예: 과장된 표현)를 비경고 응답과 효과적으로 구분할 수 있는가?
  • RQ4다양한 아키텍처의 앙상블 평균을 통해 모델 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • 10%의 응답 검토 기준에서 주목 메커니즘을 갖춘 양방향 스택형 LSTM가 가장 높은 경고 탐지율 98.7%를 기록했다.
  • 2개의 순환 유닛 층(128,128)을 스택한 것이 가장 큰 성능 향상을 가져왔으며, 단일 층 모델 대비 14.98% 높은 탐지율을 기록했다.
  • 주목 메커니즘의 사용은 평균 4.15% 향상되었고, 양방향 모델링은 2.20% 향상되었다.
  • 주목 기능이 없는 스택형 LSTM 모델도 10% 검토 기준에서 96.7%의 탐지율을 기록하여 강력한 기준 성능을 보였다.
  • LSTM 기반 모델은 GRU 기반 모델보다 평균 8.05% 높은 탐지 정확도를 기록했다.
  • 집계된 모델 출력은 최고의 개별 모델을 초월해 탐지 성능을 향상시켰으며, 향후 앙상블 기반 최적화의 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.