[論文レビュー] Efficient Classification of Student Help Requests in Programming Courses Using Large Language Models
本研究では、プログラミング授業における学生の支援要請のゼロショットおよびファインチューニング分類について、GPT-3.5とGPT-4を評価し、最小限のラベル付きデータでファインチューニングされたGPT-3.5が人間水準の正確性に達することを示した。これにより、低コストかつ実装可能性の高い方法でスケーラブルかつパーソナライズされた教育支援が可能となり、学習システムへの統合が容易になる。
The accurate classification of student help requests with respect to the type of help being sought can enable the tailoring of effective responses. Automatically classifying such requests is non-trivial, but large language models (LLMs) appear to offer an accessible, cost-effective solution. This study evaluates the performance of the GPT-3.5 and GPT-4 models for classifying help requests from students in an introductory programming class. In zero-shot trials, GPT-3.5 and GPT-4 exhibited comparable performance on most categories, while GPT-4 outperformed GPT-3.5 in classifying sub-categories for requests related to debugging. Fine-tuning the GPT-3.5 model improved its performance to such an extent that it approximated the accuracy and consistency across categories observed between two human raters. Overall, this study demonstrates the feasibility of using LLMs to enhance educational systems through the automated classification of student needs.
研究の動機と目的
- 大規模言語モデル(LLM)を用いて、大量のラベル付きデータを必要とせずに、プログラミング授業における学生の支援要請を分類する可能性を評価すること。
- GPT-3.5とGPT-4のゼロショット性能を、学生の質問用に事前に定義された分類カテゴリに対して評価すること。
- 少量のラベル付きデータでGPT-3.5をファインチューニングすることで、分類の正確性と一貫性が向上するかどうかを調査すること。
- 教育システムにおけるリアルタイムの問い合わせ分類にLLMを導入する際の費用対効果と実用的妥当性を特定すること。
- 自動分類が、パーソナライズされた応答の提供と、教員が役立つイン사이트を得るための支援をどのように向上させるかを検討すること。
提案手法
- 人間レーティングのコーディングガイドラインに基づいたプロンプト指示を用いて、API経由でGPT-3.5とGPT-4をゼロショット分類に活用した。
- 分類性能の向上を目的として、100件のラベル付き学生要請データセットを用いてGPT-3.5のファインチューニングを実施した。
- モデルの説明を回避し、直接的な分類出力を保証するために、プロンプト工学を採用した。
- F1スコアやCohenのカッパ係数といった標準指標を用いて、モデルの性能を人間レーティングと比較した。
- ゼロショットおよびファインチューニング済みのデプロイメントシナリオの両方において、トークンベースの料金モデルを用いて推論コストを評価した。
- 分類結果が教育アシスタントシステム内のカスタマイズされた応答生成やユーザーインターフェースプロンプトに活用されるパイプラインを設計した。

実験結果
リサーチクエスチョン
- RQ1RQ1: 人間レーティングのために事前に設計されたコーディング指針に基づく指示に基づいて、GPT-3.5とGPT-4は、学生の支援要請をゼロショットでどの程度正確に分類できるか?
- RQ2RQ2: 限定的なデータ量を用いたファインチューニングによって、分類性能はどの程度向上するか?
- RQ3RQ3: ファインチューニング済みのGPT-3.5は、人間レーティングと比較して、各カテゴリにおける正確性と一貫性の面でどの程度の性能を示すか?
- RQ4RQ4: 教育現場におけるリアルタイムの問い合わせ分類にゼロショットおよびファインチューニング済みのLLMをデプロイする際のコストインパクトは何か?
主な発見
- GPT-4はデバッグ関連のサブカテゴリにおいて、GPT-3.5を上回るゼロショット分類性能を示したが、他の大多数のメインカテゴリでは両モデルの性能に差がなかった。
- わずか100件のラベル付き例でファインチューニングされたGPT-3.5は、2名の人的レーティング間で観察された正確性と評価者間一貫性にまで到達した。
- 1学期にわたり2,591件の学生要請を分類するためのファインチューニング済みGPT-3.5のコストは30ドル未満であった。一方、GPT-4は80ドル、ゼロショットのGPT-3.5は4ドル未満であった。
- ゼロショットのGPT-3.5とGPT-4は、ラベル付きデータが一切不要であったにもかかわらず、妥当な分類正確性を達成した。これは、教育的問い合わせ分類において強いゼロショット一般化能力を示している。
- 本研究では、最小限のデータとインfraストラクチャでLLMが分類タスクを自動化できることを示した。これにより、スケーラブルかつパーソナライズされた教育支援システムの実現が可能になった。
- ファインチューニング済みのLLMは、チャットボットに文脈に即した応答を提供するのを支援し、集計された問い合わせパターン分析を通じて教員が問題行動を検出するのを補助できる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。