[論文レビュー] From Human Days to Machine Seconds: Automatically Answering and Generating Machine Learning Final Exams
本稿では、MIT、ハーバード、コーネルのトップレベル大学の機械学習の最終試験問題のうち646問の部分を含むベンチマークデータセットを紹介し、大規模言語モデル(LLMs)がFew-shotプロンプティングとChain-of-Thought推論を用いて、人間並みの性能でこれらの試験を解くことができることを示している。モデルは数秒で新しい高品質の試験問題を生成でき、教員の作業負荷を数日から数秒にまで削減する。
A final exam in machine learning at a top institution such as MIT, Harvard, or Cornell typically takes faculty days to write, and students hours to solve. We demonstrate that large language models pass machine learning finals at a human level, on finals available online after the models were trained, and automatically generate new human-quality final exam questions in seconds. Previous work has developed program synthesis and few-shot learning methods to solve university-level problem set questions in mathematics and STEM courses. In this work, we develop and compare methods that solve final exams, which differ from problem sets in several ways: the questions are longer, have multiple parts, are more complicated, and span a broader set of topics. We curate a dataset and benchmark of questions from machine learning final exams available online and code for answering these questions and generating new questions. We show how to generate new questions from other questions and course notes. For reproducibility and future research on this final exam benchmark, we use automatic checkers for multiple-choice, numeric, and questions with expression answers. We perform ablation studies comparing zero-shot learning with few-shot learning and chain-of-thought prompting using GPT-3, OPT, Codex, and ChatGPT across machine learning topics and find that few-shot learning methods perform best. We highlight the transformative potential of language models to streamline the writing and solution of large-scale assessments, significantly reducing the workload from human days to mere machine seconds. Our results suggest that rather than banning large language models such as ChatGPT in class, instructors should teach students to harness them by asking students meta-questions about correctness, completeness, and originality of the responses generated, encouraging critical thinking in academic studies.
研究の動機と目的
- 標準的な問題セットとは大きく異なる広範さ、複雑さ、深さを持つ包括的で多段階の最終試験の評価におけるギャップを埋める。
- MIT、ハーバード、コーネルの実際の機械学習最終試験問題を収集し、多様なトピックと問題形式をカバーする再現可能なベンチマークを構築する。
- LLMsを用いて高品質で人間らしい最終試験問題を自動的に解答・生成する手法を開発・評価する。
- 学生のアンケートを通じて、機械生成された問題の質と教育的妥当性を、人間が作成した問題と比較して評価する。
- LLMsが、試験作成および採点の分野で教員の作業負荷を人間の数日から機械の数秒にまで削減できることを実証する。
提案手法
- MIT、ハーバード、コーネルの3つのトップレベルの機械学習コースの最終試験から、理論、数学、プログラミング、概念的推論をカバーする646問の問題部分を収集したデータセットを構築した。
- 複数選択、数値、式入力の回答を自動で検証できるチェックツールを実装し、モデル出力の再現可能な評価を可能にした。
- GPT-3、OPT、Codex、ChatGPTの複数のLLMを、ゼロショット、Few-shot、Chain-of-Thoughtプロンプティングを用いて、多様な機械学習トピックと学期にわたって評価した。
- Few-shotプロンプティングの文脈として関連性の高い訓練例を特定するために、テキスト類似度埋め込み(text-similarity-babbage-001)を用いた。
- 既存の問題とコースノートをプロンプトとして与え、LLMに新しい問題を生成した。トピックの一貫性を保つためにコサイン類似度を用いた。
- 評価時には、決定論的かつ再現可能な出力を保証するため、モデルのハイパーパrameterを固定(temperature=0, top_p=0, ストップシーケンスなし)した。問題生成時には多様性を高めるために、temperature=0.1に設定した。
実験結果
リサーチクエスチョン
- RQ1長さが長く、複雑で多段階的な構造を持つ大学レベルの機械学習最終試験を、LLMsが人間並みのパフォーマンスで解くことは可能か?
- RQ2ゼロショット、Few-shot、Chain-of-Thoughtの各プロンプティング戦略は、複雑で多概念的な最終試験問題の解法において、どのように比較されるか?
- RQ3LLMsは、人間が作成した問題と区別がつかないほど高品質で教育的妥当性のある新しい最終試験問題を、どの程度生成できるか?
- RQ4学生は、機械生成された最終試験問題の質、難易度、本物らしさを、人間が作成した問題と比較してどのように評価するか?
- RQ5自動チェックツールは、複数選択、数値、式入力の多様な問題タイプに対して、標準化された方法でLLMの出力された回答を信頼性高く検証できるか?
主な発見
- Fewショット学習にChain-of-Thoughtプロンプティングを組み合わせたアプローチが、全機械学習トピックと学期において最良のパフォーマンスを示し、ゼロショットおよび通常のFew-shot手法を上回った。
- 学生は、人間が作成した問題のうち56.11%しか正しく人間製と特定できず、機械生成問題のうち45%しか機械生成と特定できなかった。これは、非常に人間らしいリアルな質を示している。
- 機械生成問題の平均難易度は2.55であり、人間作成問題の平均難易度2.85よりもわずかに易しかったが、両者ともそれぞれ82.6%および85.0%の割合でコースに適切であると評価された。
- アンケート結果から、機械生成問題は人間作成問題と同等に適切で、同等の質であると評価され、本物らしさの観点でも有意な差は認められなかった。
- 1つの問題部分の回答または生成プロセスは数秒で完了し、教員の作業負荷を人間の数日から機械の数秒にまで削減した。
- ベンチマークとデータセットは再現可能であり、評価時にモデルハイパーパrameter(temperature=0, top_p=0)を固定することで、決定論的な出力を保証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。