[논문 리뷰] From Human Days to Machine Seconds: Automatically Answering and Generating Machine Learning Final Exams
이 논문은 MIT, 하버드, 코넬 대학의 상위 수준 대학에서 나온 646개의 기계학습 기말고사 문제 부분으로 구성된 벤치마크 데이터셋을 소개하고, 대규모 언어 모델(Large Language Models, LLMs)이 소수의 예시를 통한 프롬프팅과 사고의 흐름 추론을 사용해 인간 수준의 성능으로 이러한 시험 문제를 해결할 수 있음을 보여준다. 모델들은 몇 초 내로 새로운 고품질의 시험 문제를 생성하여 강사의 작업 부담을 수일에서 수초로 줄인다.
A final exam in machine learning at a top institution such as MIT, Harvard, or Cornell typically takes faculty days to write, and students hours to solve. We demonstrate that large language models pass machine learning finals at a human level, on finals available online after the models were trained, and automatically generate new human-quality final exam questions in seconds. Previous work has developed program synthesis and few-shot learning methods to solve university-level problem set questions in mathematics and STEM courses. In this work, we develop and compare methods that solve final exams, which differ from problem sets in several ways: the questions are longer, have multiple parts, are more complicated, and span a broader set of topics. We curate a dataset and benchmark of questions from machine learning final exams available online and code for answering these questions and generating new questions. We show how to generate new questions from other questions and course notes. For reproducibility and future research on this final exam benchmark, we use automatic checkers for multiple-choice, numeric, and questions with expression answers. We perform ablation studies comparing zero-shot learning with few-shot learning and chain-of-thought prompting using GPT-3, OPT, Codex, and ChatGPT across machine learning topics and find that few-shot learning methods perform best. We highlight the transformative potential of language models to streamline the writing and solution of large-scale assessments, significantly reducing the workload from human days to mere machine seconds. Our results suggest that rather than banning large language models such as ChatGPT in class, instructors should teach students to harness them by asking students meta-questions about correctness, completeness, and originality of the responses generated, encouraging critical thinking in academic studies.
연구 동기 및 목표
- 표준 문제 세트와는 상당히 다름으로써 범위, 복잡성, 깊이에서 다릅니다.
- MIT, 하버드, 코넬에서의 실제 기계학습 기말고사 문제를 포함한 재현 가능한 벤치마크를 구축한다.
- LLMs를 사용하여 답변하고 고품질의 인간과 유사한 기말고사 문제를 자동으로 생성하고 평가하는 방법을 개발하고 평가한다.
- 학생 설문 조사로 기계가 생성한 문제의 품질과 교육적 적합성을 인간이 작성한 문제와 비교하여 평가한다.
- LLMs가 강의 평가 제작 및 채점 과정에서 강사의 작업 부담을 인간 수일에서 기계 수초로 줄일 수 있음을 보여준다.
제안 방법
- MIT, 하버드, 코넬의 상위 수준 기계학습 수업 기말고사 문제에서 이론, 수학, 코딩, 개념적 추론을 포함한 총 646개의 문제 부분을 수집한 데이터셋을 구축했다.
- 다중 선택, 숫자, 수식 기반 답변을 위한 자동 검증 도구를 구현하여 모델 출력의 재현 가능한 평가를 가능하게 하였다.
- GPT-3, OPT, Codex, ChatGPT 등 다양한 LLM을 사용하여 다양한 기계학습 주제와 학기 동안 0-샷, 소수의 예시, 사고의 흐름 추론 프롬프팅 전략을 평가하였다.
- 소수의 예시를 통한 프롬프팅을 위해 텍스트 유사도 임베딩(text-similarity-babbage-001)을 사용하여 훈련 예시 중 가장 유사한 것을 찾았으며, 이로써 맥락의 관련성을 확보하였다.
- 기존 문제와 강의 노트를 기반으로 LLM에 프롬프팅하여 새로운 문제를 생성하였으며, 주제 일관성을 확보하기 위해 코사인 유사도를 사용하였다.
- 평가 중에는 결정적인 결과를 확보하기 위해 모델 초모수를 고정(temperature=0, top_p=0, 정지 시퀀스 없음)하였고, 문제 생성 시에는 다양성을 높이기 위해 temperature=0.1로 조정하였다.
실험 결과
연구 질문
- RQ1긴 길이, 높은 복잡성, 다중 부분으로 구성된 대학 수준의 기계학습 기말고사 문제를 인간 수준의 성능으로 해결할 수 있는가?
- RQ20-샷, 소수의 예시, 사고의 흐름 추론 프롬프팅 전략 중 어떤 것이 복잡하고 다중 개념을 포함한 기말고사 문제 해결에 더 효과적인가?
- RQ3LLMs가 인간이 작성한 문제와 구분되지 않을 정도로 새로운 고품질의 교육적으로 적합한 기말고사 문제를 얼마나 잘 생성할 수 있는가?
- RQ4학생들은 기계가 생성한 기말고사 문제의 품질, 난이도, 진정성에 대해 인간이 작성한 문제와 어떻게 평가하는가?
- RQ5다양한 문제 유형(다중 선택, 숫자, 수식 기반)에 대해 자동 검증 도구가 표준화된 방식으로 LLM이 생성한 답변을 신뢰성 있게 검증할 수 있는가?
주요 결과
- 사고의 흐름 추론을 통한 소수의 예시 프롬프팅 전략이 모든 기계학습 주제와 학기 동안 가장 높은 성능를 보였으며, 0-샷 및 일반 소수의 예시 전략을 모두 능가하였다.
- 학생들은 인간이 작성한 문제 중 56.11%만 인간이 작성한 것으로 정확히 식별했고, 기계가 생성한 문제 중 45%만 기계가 생성한 것으로 식별하였다. 이는 강력한 인간 유사성의 실현을 시사한다.
- 기계가 생성한 문제의 평균 난이도는 2.55였고, 인간이 작성한 문제의 평균 난이도는 2.85였으며, 둘 다 과정에 적합하다고 평가된 비율은 각각 82.6%와 85.0%였다.
- 설문 조사 결과 기계가 생성한 문제들은 인간이 작성한 문제와 동일한 적합성과 품질로 평가되었으며, 진정성에 대한 인식 차이가 유의미하지 않았다.
- 질문 부분에 대한 답변 또는 생성 과정 전체가 몇 초 내로 완료되어 강사의 작업 부담이 인간 수일에서 기계 수초로 줄어들었다.
- 벤치마크와 데이터셋은 재현 가능하며, 평가 중 모델 초모수를 고정(temperature=0, top_p=0)함으로써 결정적인 출력이 보장되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.