Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Evaluation of Classroom Instructional Support with LLMs and BoWs: Connecting Global Predictions to Specific Feedback

Jacob Whitehill, Jennifer LoCasale‐Crouch|arXiv (Cornell University)|2023. 10. 02.
Natural Language Processing TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 전사된 교사 강의 내용에서 CLASS Instructional Support 점수를 자동으로 추정하기 위해 zero-shot LLM과 Bag-of-Words (BoW) 방법을 제안한다. 이는 인간 평가자 간 신뢰도(상관계수 R 최대 0.55)와 유사한 수준의 전역 예측 정확도(피어슨 상관계수 R 최대 0.47)를 달성하며, 모델의 해석 가능성 덕분에 발화 수준의 설명 가능하고 실천 가능한 피드백을 제공한다.

ABSTRACT

With the aim to provide teachers with more specific, frequent, and actionable feedback about their teaching, we explore how Large Language Models (LLMs) can be used to estimate ``Instructional Support'' domain scores of the CLassroom Assessment Scoring System (CLASS), a widely used observation protocol. We design a machine learning architecture that uses either zero-shot prompting of Meta's Llama2, and/or a classic Bag of Words (BoW) model, to classify individual utterances of teachers' speech (transcribed automatically using OpenAI's Whisper) for the presence of Instructional Support. Then, these utterance-level judgments are aggregated over a 15-min observation session to estimate a global CLASS score. Experiments on two CLASS-coded datasets of toddler and pre-kindergarten classrooms indicate that (1) automatic CLASS Instructional Support estimation accuracy using the proposed method (Pearson $R$ up to $0.48$) approaches human inter-rater reliability (up to $R=0.55$); (2) LLMs generally yield slightly greater accuracy than BoW for this task, though the best models often combined features extracted from both LLM and BoW; and (3) for classifying individual utterances, there is still room for improvement of automated methods compared to human-level judgments. Finally, (4) we illustrate how the model's outputs can be visualized at the utterance level to provide teachers with explainable feedback on which utterances were most positively or negatively correlated with specific CLASS dimensions.

연구 동기 및 목표

  • 교사 강의 전사본을 사용하여 CLASS Instructional Support 점수를 자동으로 추정하고 확장 가능한 방법을 개발한다.
  • 수업 대화 분석에서 전통적인 BoW 모델 대비 LLM(Zero-shot 프롬프팅)의 성능을 비교한다.
  • 전역 CLASS 점수를 개별 발화에 연결하여 교사에게 구체적이고 실천 가능한 피드백을 제공한다.
  • 모델 예측을 발화 수준에서 시각화하여 설명 가능성과 교사 참여를 증진한다.
  • 자동화된 시스템이 수업 관찰 점수 평가에서 인간 평가자 간 신뢰도에 얼마나 가까이 도달할 수 있는지 평가한다.

제안 방법

  • OpenAI의 Whisper를 사용해 수업 음성 자료를 전사하여 교사 발화의 텍스트 전사본을 확보한다.
  • Meta의 Llama2 LLM에 Zero-shot 프롬프팅을 적용하여 각 발화에 Instructional Support 지표(예: 지지 구조 제공, 개방형 질문)가 포함되어 있는지 분류한다.
  • 동일한 발화에 대해 전통적인 Bag-of-Words (BoW) 모델을 훈련시어 Instructional Support 존재 여부를 예측한다.
  • 15분 동안의 세션 동안 발화 수준의 예측을 집계하여 전역 CLASS 점수를 추정한다.
  • LLM과 BoW 특징을 앙상블 모델링을 통해 통합하여 예측 정확도를 향상시킨다.
  • 발화 수준에서 모델의 주의 집중과 예측 신뢰도를 시각화하여 높은 영향력을 가진 수업 행동을 부각시킨다.

실험 결과

연구 질문

  • RQ1Zero-shot LLM 프롬프팅을 통해 인간에 의해 주석 처리된 점수와 강하게 상관관계를 가지는 전역 CLASS Instructional Support 점수 예측이 가능한가?
  • RQ2LLM 기반 분류 성능가지 전통적인 BoW 모델 대비 발화 수준에서 Instructional Support를 예측할 때 어떤가?
  • RQ3LLM과 BoW 특징의 통합이 개별적으로 사용할 경우보다 전역 점수 추정 성능을 향상시킬 수 있는가?
  • RQ4자동화된 모델이 개별 발화 기반으로 설명 가능하고 시간적으로 국소화된 피드백을 교사에게 제공할 수 있는가?
  • RQ5자동화된 시스템이 CLASS 점수 추정에서 인간 평가자 간 신뢰도에 얼마나 가까이 다가설 수 있는가?

주요 결과

  • 제안된 방법은 자동화된 점수와 인간에 의해 주석 처리된 CLASS Instructional Support 점수 사이에 최대 R = 0.47의 피어슨 상관계수를 달성하여 인간 평가자 간 신뢰도(R = 0.55)에 가까워졌다.
  • LLM은 발화 수준의 분류에서 약간 더 뛰어난 성능를 보였지만, 최고의 성능를 보인 모델은 양 방법의 특징을 통합한 것이다.
  • 모델의 발화 수준 예측은 전역 점수와 가장 긍정적 또는 부정적으로 상관관계가 높은 특정 교사 발화를 부각시키기 위해 성공적으로 시각화되었다.
  • Llama2를 사용한 Zero-shot 프롬프팅은 미세조정이나 자동 프롬프트 엔지니어링보다 더 정확한 전역 예측을 도출했으며, 후자는 주로 중앙값 출력을 유도했다.
  • 다시 말해, 진전이 있었지만 여전히 자동화된 방법은 발화 수준에서 인간 수준의 판단 정확도에 미치지 못했으며, 향후 개선 여지가 있음을 시사한다.
  • LLM과 BoW 특징의 통합은 전역 점수 추정 성능을 향상시켰으며, 의미적 이해와 어휘 패턴 탐지의 상호보완적 강점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.