Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Grading: Near Human-level Accuracy for Automated Feedback on Richly Structured Problems

Ali Malik, Mike Wu|arXiv (Cornell University)|2019. 05. 23.
Neural Networks and Applications참고 문헌 30인용 수 10
한 줄 요약

이 논문은 교사가 작성한 확률적 시뮬레이터(Idea2Text)를 사용하여 신경망 모델의 학습 데이터를 합성 생성하는 새로운 방법인 생성형 채점(generative grading)을 소개한다. 이는 복잡한 구조를 가진 문제에 대해 인간 수준에 가까운 자동 피드백을 가능하게 한다. 이 방법은 블록 기반 프로그래밍에서 이전 최고 성능 대비 50% 향상된 초인간 수준의 정확도를 달성하였고, 그래픽 및 텍스트 응답 과제에서 각각 4배와 1.5배의 성능 향상을 보였으며, 실제 교실 환경에서 인간 채점자와 함께 사용했을 때 채점 정확도는 두 배로 높이고 시간은 절반으로 줄였다.

ABSTRACT

Access to high-quality education at scale is limited by the difficulty of providing student feedback on open-ended assignments in structured domains like computer programming, graphics, and short response questions. This problem has proven to be exceptionally difficult: for humans, it requires large amounts of manual work, and for computers, until recently, achieving anything near human-level accuracy has been unattainable. In this paper, we present generative grading: a novel computational approach for providing feedback at scale that is capable of accurately grading student work and providing nuanced, interpretable feedback. Our approach uses generative descriptions of student cognition, written as probabilistic programs, to synthesise millions of labelled example solutions to a problem; we then learn to infer feedback for real student solutions based on this cognitive model. We apply our methods to three settings. In block-based coding, we achieve a 50% improvement upon the previous best results for feedback, achieving super-human accuracy. In two other widely different domains -- graphical tasks and short text answers -- we achieve major improvement over the previous state of the art by about 4x and 1.5x respectively, approaching human accuracy. In a real classroom, we ran an experiment where we used our system to augment human graders, yielding doubled grading accuracy while halving grading time.

연구 동기 및 목표

  • 프로그래밍, 그래픽, 짧은 텍스트 응답과 같은 분야에서 개방형이고 구조화된 과제에 대해 스케일링 가능한 고품질의 세밀한 피드백을 제공하는 데 도전하는 것.
  • 데이터 부족, 레이블 희소성, 교육 분야에서 설명 가능하고 정밀한 채점이 필요한 문제를 겪는 전통적 지도 학습의 한계를 극복하는 것.
  • 학생의 의사결정 과정을 생성적 프로세스로 모델링하고 이를 반전시켜 해결책으로부터 학생의 사고 방식을 추론함으로써 인간 강사의 방식을 모방하는 시스템을 개발하는 것.
  • 사람의 채점 부담을 줄이고 일관성과 정확성을 높이며 확장 가능하고 설명 가능하며 정확한 피드백 시스템을 만드는 것.
  • 근접한 이웃 분석을 통해 잘못된 채점 원인이 되는 결정 노드를 식별함으로써 학생 시뮬레이터의 자동 개선을 가능하게 하는 것.

제안 방법

  • 이 방법은 교사가 작성한 Idea2Text 시뮬레이터—학생의 의사결정을 모델링하고 결정을 최종 해결책으로 연결하는 확률적 프로그램—을 사용한다.
  • 지능적인 샘플링을 통해 이 시뮬레이터에서 수백만 개의 합성된 레이블이 부여된 해결책 예제를 생성하여 다양한 학생의 작업 패턴을 커버한다.
  • 심층 신경망을 학습시켜 실제 학생의 해결책을 바탕으로 그들이 가능성이 높은 결정의 순서로 되돌아가게 한다.
  • 모델은 가변 길이의 시퀀스와 고정되지 않은 레이블을 처리할 수 있도록 고안된 새로운 미분 가능 아키텍처를 사용하여, 레이블이 부여된 인간 피드백 없이도 엔드 투 엔드 학습이 가능하다.
  • 예측 결과를 시뮬레이터의 특정 결정 노드와 연결함으로써 설명 가능성을 확보하며, 오류 지역 규명 및 세그먼트 기반 피드백을 가능하게 한다.
  • 어려운 케이스에서 구문 분석 실패를 반복적으로 유발하는 결정 노드를 식별함으로써 시뮬레이터의 반복적 개선을 지원한다.

실험 결과

연구 질문

  • RQ1교사가 작성한 시뮬레이터를 기반으로 한 생성 모델링 접근법이 개방형이고 구조화된 문제에 대해 인간 수준에 가까운 정확도의 자동 피드백을 달성할 수 있는가?
  • RQ2이 방법은 다중 선택 문제 외의 분야, 예를 들어 블록 기반 프로그래밍, 그래픽 작업, 짧은 텍스트 응답과 같은 분야에서 얼마나 효과적인가?
  • RQ3실제 교육 현장에서 이 시스템은 인간의 채점 부담을 얼마나 줄일 수 있으며, 정확성과 일관성은 어떻게 향상되는가?
  • RQ4이 시스템은 실패 패tern을 기반으로 잘못된 구성 요소를 자동으로 식별하고 학생 시뮬레이터의 개선을 제안할 수 있는가?
  • RQ5피드백 품질과 확장성 측면에서 이 방법은 이전 최고 수준의 방법들과 비교해 어떻게 성과를 내는가?

주요 결과

  • 블록 기반 프로그래밍 과제에서 이 방법은 이전 최고 성능 대비 50% 향상되어 인간 수준의 정확도를 초월했다.
  • 그래픽 과제에서 시스템은 이전 최고 수준 대비 4배 향상되어 인간 수준의 성능에 가까워졌다.
  • 짧은 텍스트 응답 과제에서 이 방법은 이전 성능 대비 1.5배 향상되어 인간 채점 정확도에 훨씬 가까워졌다.
  • 실제 CS1 교실 실험에서 인간 채점자와 함께 사용했을 때 시스템은 채점 정확도를 두 배로 높였고, 시간은 절반으로 줄였다.
  • 수정된 시뮬레이터에서 구문 분석 실패를 일으키는 상위 6개의 결정 노드를 성공적으로 식별하였으며, 이들은 모두 오류 유형과 의미적으로 관련이 있었다.
  • 이 방법은 특정 결정 노드와 예측 결과를 연결함으로써 설명 가능한 피드백을 가능하게 하여, 학생의 사고 과정에 대한 세그먼트 기반 통찰을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.