[論文レビュー] Performance of Large Language Models in a Computer Science Degree Program
本研究では、GPT-4.0、ChatGPT-3.5、BingAI、LLaMAバージョンを含む大規模言語モデル(LLMs)を、コンピュータサイエンスの学士課程課程で評価する。10のモジュールにわたる講義内容、演習問題、過去試験に対してプロンプトを入力することで、GPT-4.0は平均80.2%のスコアを記録したが、数学的推論能力に欠けるため学位取得に失敗した。これは、テキストベースのタスクでは優れたパフォーマンスを示すものの、根本的な制限が依然として存在することを示している。
Large language models such as ChatGPT-3.5 and GPT-4.0 are ubiquitous and dominate the current discourse. Their transformative capabilities have led to a paradigm shift in how we interact with and utilize (text-based) information. Each day, new possibilities to leverage the capabilities of these models emerge. This paper presents findings on the performance of different large language models in a university of applied sciences' undergraduate computer science degree program. Our primary objective is to assess the effectiveness of these models within the curriculum by employing them as educational aids. By prompting the models with lecture material, exercise tasks, and past exams, we aim to evaluate their proficiency across different computer science domains. We showcase the strong performance of current large language models while highlighting limitations and constraints within the context of such a degree program. We found that ChatGPT-3.5 averaged 79.9% of the total score in 10 tested modules, BingAI achieved 68.4%, and LLaMa, in the 65 billion parameter variant, 20%. Despite these convincing results, even GPT-4.0 would not pass the degree program - due to limitations in mathematical calculations.
研究の動機と目的
- 大規模言語モデル(LLMs)がコンピュータサイエンスの学士課程教育においてどれほど効果的であるかを評価すること。
- 理論的・プログラミング的・数学的要素を含む多様なコンピュータサイエンスモジュールにおいて、LLMのパフォーマンスを評価すること。
- GPT-4.0、ChatGPT-3.5、BingAI、LLaMAバージョンなどの主要LLMの、学術的タスクにおける強みと弱みを特定すること。
- 現在のLLMが学生の学習支援として実用的であるか、あるいは学術的誠実性に脅かすリスクをもたらすかを検討すること。
- LLMの能力と限界を踏まえて、カリキュラム設計と評価戦略にどのように影響を与えるかを示すこと。
提案手法
- 10のコンピュータサイエンスモジュールから実際の講義資料、演習問題、過去試験を収集し、合計40件のデータポイントを取得してLLMをテストした。
- 一貫性と現実世界の関連性を確保するため、実際の課程内容に基づいた標準化されたプロンプトを使用した。
- スコアは、全得点に対する割合として正規化され、テキストベースの推論と数学的問題解決の両方のタスクで評価した。
- アーキテクチャとパラメータスケールが異なるモデルを対象とし、GPT-4.0、ChatGPT-3.5、BingAI、LLaMA-65B-Q、LLaMA-7B-Q、StableLM-7Bを選定した。
- 比較評価フレームワークを適用し、テストされたモジュール全体にわたる各モデルの平均スコアを算出した。
- 特に計算が複雑なタスクや複雑な文脈のタスクにおいて、文脈保持能力、事実の正確性、一貫性を評価した。
実験結果
リサーチクエスチョン
- RQ1主要なLLMは、実際の学士課程のコンピュータサイエンス教材(試験や演習問題を含む)でどの程度のパフォーマンスを示すか?
- RQ2GPT-4.0、ChatGPT-3.5、BingAI、およびLLaMA-65B-Qのような小規模LLMは、学術的コンピュータサイエンスタスクにおいて、どのような主な強みと弱みを示すか?
- RQ3複数のモジュールにわたるパフォーマンスに基づいて、LLMがコンピュータサイエンスの学士号課程に合格できる程度はどの程度か?
- RQ4数学的推論能力と計算の正確性は、技術的コンピュータサイエンス分野におけるLLMのパフォーマンスにどのように影響するか?
- RQ5LLMは高等教育における有効な教育支援ツールとして機能できるか、それともその限界がその有用性を損なうか?
主な発見
- GPT-4.0は6つのテストモジュールで平均80.2%のスコアを記録し、テキストベースおよび概念的コンピュータサイエンスタスクにおいて優れたパフォーマンスを示した。
- ChatGPT-3.5は10のモジュールで79.9%のスコアを記録し、10中9つを合格した。これは、非数学的分野において高い信頼性を示している。
- BingAIは10のモジュールで68.4%のスコアを記録し、2つに失敗した。特に検索不能または文脈的に複雑な質問で苦戦した。
- LLaMA-65B-Qは2つのモジュールで平均20.0%のスコアを記録し、限られた能力を示し、いかなるタスクも正しく解けなかった。
- LLaMA-7B-Qは6つのモジュールで12.3%のスコアを記録し、すべてのタスクに失敗した。文脈を失い、関係のない内容を生成する傾向が強かった。
- StableLM-7Bは最低スコア10.8%を記録し、いかなる質問に対しても正しく回答できず、ビジネス文脈の質問を頻繁に誤解した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。