Skip to main content
QUICK REVIEW

[論文レビュー] Automated Evaluation of Classroom Instructional Support with LLMs and BoWs: Connecting Global Predictions to Specific Feedback

Jacob Whitehill, Jennifer LoCasale‐Crouch|arXiv (Cornell University)|Oct 2, 2023
Natural Language Processing TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、教師の発話音声を音声認識したテキストを用いて、ゼロショットLLMとBag-of-Words(BoW)手法を組み合わせ、CLASSの指導的支援スコアを自動で推定する手法を提案する。教師間信頼性(R = 0.55)に匹敵する水準のグローバル予測精度(ピアソン相関係数R = 0.47)を達成するとともに、モデルの解釈可能性により、発話単位レベルの説明可能なフィードバックを提供する。

ABSTRACT

With the aim to provide teachers with more specific, frequent, and actionable feedback about their teaching, we explore how Large Language Models (LLMs) can be used to estimate ``Instructional Support'' domain scores of the CLassroom Assessment Scoring System (CLASS), a widely used observation protocol. We design a machine learning architecture that uses either zero-shot prompting of Meta's Llama2, and/or a classic Bag of Words (BoW) model, to classify individual utterances of teachers' speech (transcribed automatically using OpenAI's Whisper) for the presence of Instructional Support. Then, these utterance-level judgments are aggregated over a 15-min observation session to estimate a global CLASS score. Experiments on two CLASS-coded datasets of toddler and pre-kindergarten classrooms indicate that (1) automatic CLASS Instructional Support estimation accuracy using the proposed method (Pearson $R$ up to $0.48$) approaches human inter-rater reliability (up to $R=0.55$); (2) LLMs generally yield slightly greater accuracy than BoW for this task, though the best models often combined features extracted from both LLM and BoW; and (3) for classifying individual utterances, there is still room for improvement of automated methods compared to human-level judgments. Finally, (4) we illustrate how the model's outputs can be visualized at the utterance level to provide teachers with explainable feedback on which utterances were most positively or negatively correlated with specific CLASS dimensions.

研究の動機と目的

  • 教師の発話トランスクリプトを用いて、自動的かつスケーラブルなCLASS指導的支援スコア推定手法を開発すること。
  • LLM(ゼロショットプロンプティング)と従来のBoWモデルの両者を、教室内会話分析の文脈で比較すること。
  • グローバルなCLASSスコアと個々の発話を関連付けることで、教師に具体的かつ実行可能なフィードバックを提供すること。
  • モデルの予測を発話単位レベルで可視化し、解釈可能性を高め、教師の関与を促進すること。
  • 自動化システムが、教室観察スコア評価において人間の評価者間信頼性にどれほど近づけるかを評価すること。

提案手法

  • OpenAIのWhisperを用いて教室の音声をトランスクリプト化し、教師発話のテキストを取得する。
  • MetaのLlama2 LLMをゼロショットプロンプティングで適用し、各発話に指導的支援の兆候(例:スラッジング、開放的質問)が含まれるかを分類する。
  • 同じ発話データに対して従来のBag-of-Words(BoW)モデルを訓練し、指導的支援の有無を予測する。
  • 15分間のセッションにわたる発話単位の予測を集約し、グローバルなCLASSスコアを推定する。
  • LLMとBoWの特徴をアンサンブルモデリングで統合し、予測精度を向上させる。
  • 発話単位レベルでモデルの注目度と予測の信頼性を可視化し、高効果な指導行動を強調する。

実験結果

リサーチクエスチョン

  • RQ1ゼロショットLLMプロンプティングは、人間がアノテートしたスコアと強く相関するグローバルなCLASS指導的支援スコア推定を達成できるか?
  • RQ2発話単位レベルでの指導的支援予測において、LLM分類は従来のBoWモデルと比べてどれほど優れているか?
  • RQ3LLMとBoWの特徴を統合することで、単独の手法よりもグローバルスコア推定の精度が向上するか?
  • RQ4自動化されたモデルは、個々の発話を根拠として、説明可能で時間的局所化されたフィードバックを教師に提供できるか?
  • RQ5自動化システムは、CLASSスコア推定において、人間の評価者間信頼性にどれほど近づけるか?

主な発見

  • 提案手法は、自動推定と人間がアノテートしたCLASS指導的支援スコアの間に最大R = 0.47のピアソン相関係数を達成し、人間の評価者間信頼性(R = 0.55)に近づいた。
  • LLMは発話単位分類においてわずかにBoWモデルを上回ったが、最良の性能を示したモデルは両手法の特徴を統合していた。
  • モデルの発話単位レベルの予測は、グローバルスコアと最も強く相関する肯定的または否定的影響を持つ特定の教師発話を強調する形で成功裏に可視化された。
  • Llama2を用いたゼロショットプロンプティングは、微調整や自動プロンプト設計よりも高いグローバル予測精度を示し、中間値のみの出力にとどまらなかった。
  • 進展はあったが、依然として自動手法は発話単位レベルでの人間の判断精度に達していないことから、さらなる改善の余地があることが示された。
  • LLMとBoWの特徴統合によりグローバルスコア推定が向上した。これは、意味的理解と語彙的パターン検出の両方における相補的な強みを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。