Skip to main content
QUICK REVIEW

[논문 리뷰] Zero Shot Learning for Code Education: Rubric Sampling with Deep Learning Inference

Mike Wu, Milan Mosse|arXiv (Cornell University)|2018. 09. 05.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 5
한 줄 요약

이 논문은 '루브릭 샘플링'—사용자 인식을 통한 인간 중심의 방법으로 프로그래밍 오류 쌍 p(x,y)에 대한 전문가 사전 지식을 확보하여 이전 데이터가 없더라도 딥 러닝 추론 p(y|x)를 가능하게 하는 제로샷 피드백 시스템을 소개한다. 이는 인간 수준의 정확도를 달성하며 기존 기준 대비 F1 점수를 두 배로 높이며, 피드백의 근거 제공, 시간적 추적, 합성 데이터셋 생성을 가능하게 한다.

ABSTRACT

In modern computer science education, massive open online courses (MOOCs) log thousands of hours of data about how students solve coding challenges. Being so rich in data, these platforms have garnered the interest of the machine learning community, with many new algorithms attempting to autonomously provide feedback to help future students learn. But what about those first hundred thousand students? In most educational contexts (i.e. classrooms), assignments do not have enough historical data for supervised learning. In this paper, we introduce a human-in-the-loop "rubric sampling" approach to tackle the "zero shot" feedback challenge. We are able to provide autonomous feedback for the first students working on an introductory programming assignment with accuracy that substantially outperforms data-hungry algorithms and approaches human level fidelity. Rubric sampling requires minimal teacher effort, can associate feedback with specific parts of a student's solution and can articulate a student's misconceptions in the language of the instructor. Deep learning inference enables rubric sampling to further improve as more assignment specific student data is acquired. We demonstrate our results on a novel dataset from Code.org, the world's largest programming education platform.

연구 동기 및 목표

  • 기존 학생 데이터가 없는 상황에서도 대규모 프로그래밍 교육에서 고급 수준의 피드백을 제공하는 데 도전한다.
  • 라벨링 비용이 막대하고 비현실적인 저자료 환경에서의 지도 학습의 한계를 극복한다.
  • 기존 예시가 없더라도 새로운 프로그래밍 과제에 첫 학생을 대상으로 정확하고 해석 가능한 피드백을 제공할 수 있는 방법을 개발한다.
  • 피드백을 특정 코드 세그먼트에 근거를 두고 할당하고 학생의 오류 개념에 대한 장기적 추적을 지원한다.
  • 더 많은 과제 특화 데이터를 활용할수록 향상되는 데이터 효율적인 프레임워크를 개발한다.

제안 방법

  • 전문가가 주어진 오류 개념에 대해 가능한 프로그램을 생성하도록 요청함으로써, 학생 프로그램 x와 그 오류 개념 y의 연합 분포 p(x,y)에 대한 전문가 사전 지식을 확보하기 위해 '루브릭 샘플링'을 사용한다.
  • 딥 제너레이티브 모델(MVAE)을 활용하여 루브릭 샘플링에서 유도된 합성 데이터와 레이블이 없는 실제 학생 데이터 사이의 보간을 통해 학생 프로그램의 진짜 분포를 학습한다.
  • 모델이 빈번한 프로그램을 암기하는 것을 방지하고 희귀한 꼬리 영역 솔루션의 보다 좋은 커버리지 확보를 위해 레이블이 없는 데이터에 로그-지프트 변환을 적용한다.
  • 루브릭 샘플링에서 유도된 합성 프로그램과 실제 학생 프로그램의 혼합물에 대해 MVAE를 훈련시켜 실측 데이터 분포에 대한 정밀도를 향상시킨다.
  • 훈련된 MVAE를 사용해 새로운, 알려지지 않은 학생 프로그램에 대해 추론 p(y|x)를 수행함으로써 제로샷 피드백 예측을 가능하게 한다.
  • 전문가 지식이 확보되지 않은 경우, 유전적 전략을 활용해 루브릭 샘플링의 최적 파라미터(θ)를 자동으로 학습함으로써 모델의 강건성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존 학생 데이터가 전혀 없더라도 제로샷 피드백 시스템이 인간 수준의 정확도로 학생의 오류 개념을 식별할 수 있는가?
  • RQ2희귀하지만 의미 있는 오류의 긴 尾(꼬리) 영역에서, 루브릭 샘플링이 학생 프로그램의 분포를 얼마나 잘 포괄하는가?
  • RQ3딥 제너레이티브 모델(MVAE)이 루브릭 기반 합성 데이터와 실제 레이블이 없는 학생 데이터를 조합함으로써 피드백 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4시스템은 피드백을 특정 코드 세그먼트에 근거를 두고 할당하고 학생 학습의 장기적 추적을 지원할 수 있는가?
  • RQ5저자료 환경에서 루브릭 샘플링의 성능은 데이터 집약적인 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • 딥 러닝 추론과 함께 루브릭 샘플링을 적용한 결과, 기준 대비 F1 점수를 두 배로 높이며 제로샷 피드백 예측에서 인간 수준의 정확도에 가까워졌다.
  • 이 방법은 기존의 데이터 집약적인 최신 알고리즘을 뛰어넘었으며, 전혀 예전 예시가 없더라도 새로운 과제에 대한 일반화 능력이 뛰어나다는 것을 입증했다.
  • 루브릭 샘플링과 실제 학생 데이터의 혼합물에 훈련된 MVAE는 PCFG 기반의 합성 모델보다 실제 학생 프로그램 분포(D_unlabeled)를 훨씬 더 잘 커버했다.
  • 로그-지프트 변환은 빈번한 프로그램을 암기하는 것을 효과적으로 방지하여 희귀하고 오류가 발생하기 쉬운 솔루션의 커버리지가 향상되었다.
  • 루브릭을 작성하는 데 평균 19.4분이 소요된 반면, 교사가 800개의 프로그램을 레이블링하는 데에는 평균 24.9시간이 걸려, 이 방법의 효율성이 뚜렷하게 드러났다.
  • 유전적 전략을 통해 루브릭 파라미터(θ)를 학습한 결과, 일부 경우에서 수작업으로 설정한 파라미터보다 우수했으며, 성능 격차를 줄이고 특정 과제에서는 전문가의 선택을 뛰어넘는 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.