[논문 리뷰] Exploring the MIT Mathematics and EECS Curriculum Using Large Language Models
본 논문은 MIT Math와 EECS에서 4,550-question 데이터셋을 구성하고, LLM의 졸업 요건 충족 능력을 평가하며, 자동 채점과 문제 임베딩을 통해 커리큘럼에 대한 통찰을 제시한다.
We curate a comprehensive dataset of 4,550 questions and solutions from problem sets, midterm exams, and final exams across all MIT Mathematics and Electrical Engineering and Computer Science (EECS) courses required for obtaining a degree. We evaluate the ability of large language models to fulfill the graduation requirements for any MIT major in Mathematics and EECS. Our results demonstrate that GPT-3.5 successfully solves a third of the entire MIT curriculum, while GPT-4, with prompt engineering, achieves a perfect solve rate on a test set excluding questions based on images. We fine-tune an open-source large language model on this dataset. We employ GPT-4 to automatically grade model responses, providing a detailed performance breakdown by course, question, and answer type. By embedding questions in a low-dimensional space, we explore the relationships between questions, topics, and classes and discover which questions and classes are required for solving other questions and classes through few-shot learning. Our analysis offers valuable insights into course prerequisites and curriculum design, highlighting language models' potential for learning and improving Mathematics and EECS education.
연구 동기 및 목표
- MIT Mathematics와 EECS 졸업 요건에 대해 LLM을 평가하는 동기를 제시한다.
- MIT 강의의 문제와 해답으로 구성된 포괄적 데이터셋을 모은다.
- MIT 문제의 해결 및 채점에 대한 GPT-3.5와 GPT-4의 성능을 평가한다.
- 저차원 임베딩과 소수샷 학습을 통해 커리큘럼 간의 관계를 탐색한다.
- 커리큘럼 설계에 대한 통찰과 LLM의 잠재적 교육 활용에 대한 시사점을 제공한다.
제안 방법
- MIT Math 및 EECS 강의의 4,550개 문제와 해답으로 데이터셋을 구성한다.
- 전 교과 과정에서 문제 해결에 대해 GPT-3.5와 GPT-4를 평가한다.
- 데이터셋에 대해 오픈 소스 LLM을 미세 조정한다.
- GPT-4를 사용해 모델 응답을 자동 채점하고 과목, 문제, 답 유형별로 성능을 분석한다.
- 질문을 저차원 공간에 임베드하여 질문, 주제 및 수업 간의 관계를 분석한다.
- few-shot 학습을 적용하여 선행 조건과 교차 수업 해결 가능성을 평가한다.
실험 결과
연구 질문
- RQ1LLMs가 MIT Mathematics와 EECS의 문제를 해결하여 졸업 요건을 충족할 수 있는가?
- RQ2MIT 문제 세트 데이터 해결에서 GPT-3.5와 GPT-4의 성능은 얼마나 우수한가?
- RQ3오픈 소스 LLM의 미세 조정이 MIT 문제 해결 과제와의 정합성을 향상시킬 수 있는가?
- RQ4임베딩 기반 분석이 선수 과목 구조와 커리큘럼 설계에 대해 어떤 시사점을 제공하는가?
- RQ5GPT-4를 통한 자동 채점이 코스 수준의 상세한 성능 통찰을 제공할 수 있는가?
주요 결과
- GPT-3.5는 MIT 커리큘럼의 약 1/3을 해결한다.
- GPT-4는 이미지 기반 문제를 제외한 테스트 세트에서 프롬프트 엔지니어링으로 완벽한 해결 비율을 달성한다.
- 데이터셋에 대해 오픈 소스 LLM을 미세 조정하는 것은 실행 가능하고 유익하다.
- GPT-4는 모델 응답을 자동으로 채점하고 과목, 문제 및 응답 유형별 성능 세부 정보를 제공할 수 있다.
- 저차원 임베딩은 질문, 주제, 수업 간의 관계를 드러내고 few-shot 학습을 통해 선행 구조를 식별하는 데 도움을 준다.
- 이 분석은 커리큘럼 설계와 수학 및 EECS 교육의 학습 및 향상에서 LLM의 역할에 대한 통찰을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.