Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the MIT Mathematics and EECS Curriculum Using Large Language Models

Sarah Zhang, Samuel Florin|arXiv (Cornell University)|2023. 06. 15.
Oil and Gas Production Techniques인용 수 18
한 줄 요약

본 논문은 MIT Math와 EECS에서 4,550-question 데이터셋을 구성하고, LLM의 졸업 요건 충족 능력을 평가하며, 자동 채점과 문제 임베딩을 통해 커리큘럼에 대한 통찰을 제시한다.

ABSTRACT

We curate a comprehensive dataset of 4,550 questions and solutions from problem sets, midterm exams, and final exams across all MIT Mathematics and Electrical Engineering and Computer Science (EECS) courses required for obtaining a degree. We evaluate the ability of large language models to fulfill the graduation requirements for any MIT major in Mathematics and EECS. Our results demonstrate that GPT-3.5 successfully solves a third of the entire MIT curriculum, while GPT-4, with prompt engineering, achieves a perfect solve rate on a test set excluding questions based on images. We fine-tune an open-source large language model on this dataset. We employ GPT-4 to automatically grade model responses, providing a detailed performance breakdown by course, question, and answer type. By embedding questions in a low-dimensional space, we explore the relationships between questions, topics, and classes and discover which questions and classes are required for solving other questions and classes through few-shot learning. Our analysis offers valuable insights into course prerequisites and curriculum design, highlighting language models' potential for learning and improving Mathematics and EECS education.

연구 동기 및 목표

  • MIT Mathematics와 EECS 졸업 요건에 대해 LLM을 평가하는 동기를 제시한다.
  • MIT 강의의 문제와 해답으로 구성된 포괄적 데이터셋을 모은다.
  • MIT 문제의 해결 및 채점에 대한 GPT-3.5와 GPT-4의 성능을 평가한다.
  • 저차원 임베딩과 소수샷 학습을 통해 커리큘럼 간의 관계를 탐색한다.
  • 커리큘럼 설계에 대한 통찰과 LLM의 잠재적 교육 활용에 대한 시사점을 제공한다.

제안 방법

  • MIT Math 및 EECS 강의의 4,550개 문제와 해답으로 데이터셋을 구성한다.
  • 전 교과 과정에서 문제 해결에 대해 GPT-3.5와 GPT-4를 평가한다.
  • 데이터셋에 대해 오픈 소스 LLM을 미세 조정한다.
  • GPT-4를 사용해 모델 응답을 자동 채점하고 과목, 문제, 답 유형별로 성능을 분석한다.
  • 질문을 저차원 공간에 임베드하여 질문, 주제 및 수업 간의 관계를 분석한다.
  • few-shot 학습을 적용하여 선행 조건과 교차 수업 해결 가능성을 평가한다.

실험 결과

연구 질문

  • RQ1LLMs가 MIT Mathematics와 EECS의 문제를 해결하여 졸업 요건을 충족할 수 있는가?
  • RQ2MIT 문제 세트 데이터 해결에서 GPT-3.5와 GPT-4의 성능은 얼마나 우수한가?
  • RQ3오픈 소스 LLM의 미세 조정이 MIT 문제 해결 과제와의 정합성을 향상시킬 수 있는가?
  • RQ4임베딩 기반 분석이 선수 과목 구조와 커리큘럼 설계에 대해 어떤 시사점을 제공하는가?
  • RQ5GPT-4를 통한 자동 채점이 코스 수준의 상세한 성능 통찰을 제공할 수 있는가?

주요 결과

  • GPT-3.5는 MIT 커리큘럼의 약 1/3을 해결한다.
  • GPT-4는 이미지 기반 문제를 제외한 테스트 세트에서 프롬프트 엔지니어링으로 완벽한 해결 비율을 달성한다.
  • 데이터셋에 대해 오픈 소스 LLM을 미세 조정하는 것은 실행 가능하고 유익하다.
  • GPT-4는 모델 응답을 자동으로 채점하고 과목, 문제 및 응답 유형별 성능 세부 정보를 제공할 수 있다.
  • 저차원 임베딩은 질문, 주제, 수업 간의 관계를 드러내고 few-shot 학습을 통해 선행 구조를 식별하는 데 도움을 준다.
  • 이 분석은 커리큘럼 설계와 수학 및 EECS 교육의 학습 및 향상에서 LLM의 역할에 대한 통찰을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.