[論文レビュー] Is ChatGPT a Good Teacher Coach? Measuring Zero-Shot Performance For Scoring and Providing Actionable Insights on Classroom Instruction
本稿では、ChatGPTがゼロショットで自動的な教師コーチとして機能する能力を評価する。3つのタスク、すなわち観察用チェックリスト(CLASSおよびMQI)を用いた教室記録のスコアリング、指導上の優れた点と改善の余地の特定、学生の思考を引き出すための実行可能なフィードバックの生成について評価している。一見関連性のある応答を生成するが、ChatGPTは教師がすでに実施している行動(提案の82%)を繰り返し提案しており、フィードバックの洞察力や独自性に欠ける。これは、真実性があり、独自性があり、教育的意味を持つコーチングフィードバックを生成する上で、著しい改善の余地があることを示している。
Coaching, which involves classroom observation and expert feedback, is a widespread and fundamental part of teacher training. However, the majority of teachers do not have access to consistent, high quality coaching due to limited resources and access to expertise. We explore whether generative AI could become a cost-effective complement to expert feedback by serving as an automated teacher coach. In doing so, we propose three teacher coaching tasks for generative AI: (A) scoring transcript segments based on classroom observation instruments, (B) identifying highlights and missed opportunities for good instructional strategies, and (C) providing actionable suggestions for eliciting more student reasoning. We recruit expert math teachers to evaluate the zero-shot performance of ChatGPT on each of these tasks for elementary math classroom transcripts. Our results reveal that ChatGPT generates responses that are relevant to improving instruction, but they are often not novel or insightful. For example, 82% of the model's suggestions point to places in the transcript where the teacher is already implementing that suggestion. Our work highlights the challenges of producing insightful, novel and truthful feedback for teachers while paving the way for future research to address these obstacles and improve the capacity of generative AI to coach teachers.
研究の動機と目的
- 生成的AI(例:ChatGPT)が、熟練教師のコーチングの代替手段としてスケーラブルでコスト効率の良い選択肢となり得るかを調査すること。
- ChatGPTの3つの中心的教師コーチングタスク(スコアリング、指導上の強み・課題の特定、実行可能なフィードバックの生成)におけるゼロショット性能を評価すること。
- AIが生成するフィードバックの関連性、忠実性、洞察力、独自性を熟練した人間の評価と比較して評価すること。
- 現実の教室状況において、高品質で教育的意味を持つコーチングフィードバックを提供するための現在のLLMの限界を特定すること。
提案手法
- CLASSおよびMQIの観察インSTRUMENTでラベル付けされた小学校の算数授業記録のアノテート済みデータセット(NCTEデータセット)を用いる。
- ゼロショットプロンプティングを用いて、ChatGPTを3つのタスクで評価する:(A) チェックリスト項目を用いた記録セグメントのスコアリング、(B) 優れた点と改善の余地の特定、(C) 学生の思考を引き出すための提案の生成。
- 熟練した算数教師による人間評価を収集し、関連性、忠実性、洞察力、実行可能性といった基準に基づいてモデル出力の質を評価する。
- 関連性(0.23)、忠実性(0.36)、洞察力(0.37)の各項目について、重み付きCohenの kappa を用いてアノテーター間整合性を計算する。
- モデルが生成したスコアと人間がアノテートしたスコアを比較し、相関関係を評価するが、低水準の一致が確認された。
- 提案が記録にすでに記載された行動を参照しているかどうかをチェックすることで、出力の重複度を分析する。

実験結果
リサーチクエスチョン
- RQ1ChatGPTは、既存の観察インSTRUMENTを用いたゼロショットプロンプティングによって、教室指導の正確で信頼性のあるスコアを生成できるか?
- RQ2ChatGPTは熟練した人間の評価者と比較して、教室記録における指導上の優れた点と改善の余地をどれほど的確に特定できるか?
- RQ3ChatGPTの学生の思考を引き出すための提案は、どれほど独自性があり、実行可能で、記録内容に忠実か?
- RQ4ChatGPTのフィードバック提案が、教師が記録内ですでに実施している行動を記述する頻度はどの程度か?
- RQ5人間の評価者間で、AIが生成したコーチングフィードバックの質についてどの程度の合意が得られているか?
主な発見
- ChatGPTの予測スコアは、チェックリストの項目すべてで人間がアノテートしたスコアと低相関であった。チェックリストの詳細と推論プロンプトを提示しても同様の結果であった。
- タスクB(優れた点と改善の余地の特定)の50–70%の応答が熟練評価者によって「洞察力に欠ける」と評価された。
- タスクBの35–50%の応答が、プロンプトや記録内容に対して「関連性がない」と評価された。
- タスクCで生成された提案の82%が、記録内で教師がすでに実施している行動を記述しており、高い重複度を示した。
- 人間の評価者間では、出力の質について中程度の合意が得られたが、関連性(0.23)、忠実性(0.36)、洞察力(0.37)の重み付きCohenのkappaはいずれも低水準であった。
- アノテーター間合意が低くても、モデル出力は一貫して「関連性があり」「実行可能」であるが、「洞察力に欠ける」と評価された。これは、独自性があり、教育的意味を持つフィードバックを生成する上で改善の余地があることを示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。