Skip to main content
QUICK REVIEW

[논문 리뷰] Performance of Large Language Models in a Computer Science Degree Program

Timothy Krüger, Michael Gref|arXiv (Cornell University)|2023. 07. 24.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 연구는 컴퓨터공학 학부 교육 과정 내에서 GPT-4.0, ChatGPT-3.5, BingAI, LLaMA 변종과 같은 대규모 언어 모델(LMs)을 평가한다. 10개 모듈에 걸쳐 강의 자료, 연습 문제, 과거 시험 문제를 프롬프트로 제공한 결과, GPT-4.0는 평균 80.2%의 점수를 기록했지만, 여전히 약한 수학적 추론 능력으로 인해 학위를 통과하지 못했다. 이는 텍스트 기반 작업에서 뛰어난 성능을 보이지만도 핵심적인 제한 요소가 있음을 시사한다.

ABSTRACT

Large language models such as ChatGPT-3.5 and GPT-4.0 are ubiquitous and dominate the current discourse. Their transformative capabilities have led to a paradigm shift in how we interact with and utilize (text-based) information. Each day, new possibilities to leverage the capabilities of these models emerge. This paper presents findings on the performance of different large language models in a university of applied sciences' undergraduate computer science degree program. Our primary objective is to assess the effectiveness of these models within the curriculum by employing them as educational aids. By prompting the models with lecture material, exercise tasks, and past exams, we aim to evaluate their proficiency across different computer science domains. We showcase the strong performance of current large language models while highlighting limitations and constraints within the context of such a degree program. We found that ChatGPT-3.5 averaged 79.9% of the total score in 10 tested modules, BingAI achieved 68.4%, and LLaMa, in the 65 billion parameter variant, 20%. Despite these convincing results, even GPT-4.0 would not pass the degree program - due to limitations in mathematical calculations.

연구 동기 및 목표

  • 대규모 언어 모델(LMs)이 컴퓨터공학 학부 교육 과정 내에서 교육 보조 수단으로서 효과적인지 평가하는 것.
  • 이론적, 프로그래밍적, 수학적 구성 요소를 포함한 다양한 컴퓨터공학 모듈에서 LLM의 성능을 평가하는 것.
  • GPT-4.0, ChatGPT-3.5, BingAI, LLaMA 변종과 같은 주요 LLM의 강점과 한계를 학술 과제 적용 시점에서 규명하는 것.
  • 현재 LLM이 학생 학습을 위한 실질적인 도구로 기능할 수 있는지 또는 학업 정직성에 위협이 될 수 있는지 검토하는 것.
  • LLM의 능력과 한계를 고려해 커리큘럼 설계 및 평가 전략을 개선하는 데 기여하는 것.

제안 방법

  • 실제 과정 자료인 10개 컴퓨터공학 모듈의 강의 노트, 연습 문제, 과거 시험 문제를 바탕으로 총 40개 데이터 포인트를 확보하였다.
  • 일致성과 실제 적용 가능성을 확보하기 위해 실제 과정 내용을 기반으로 표준화된 프롬프트를 사용하였다.
  • 점수는 총 가능한 점수에 대한 백분율로 정규화되었으며, 텍스트 기반 추론 및 수학적 문제 해결 과제를 모두 평가하였다.
  • 다양한 아키텍처와 파rameter 스케일을 가진 모델을 선별: GPT-4.0, ChatGPT-3.5, BingAI, LLaMA-65B-Q, LLaMA-7B-Q, StableLM-7B.
  • 비교 평가 프레임워크를 적용하여 테스트된 모듈 전반에 걸쳐 각 모델의 평균 점수를 계산하였다.
  • 특히 복잡하거나 계산이 많은 과제에서의 맥락 유지 능력, 사실 정확도, 일관성 등을 평가하였다.

실험 결과

연구 질문

  • RQ1주요 LLM은 실제 학부 컴퓨터공학 과정 자료, 즉 시험 문제와 연습 문제에서 어떤 성능을 보이는가?
  • RQ2GPT-4.0, ChatGPT-3.5, BingAI, 그리고 LLaMA-65B-Q와 같은 작은 LLM은 학술 컴퓨터공학 과제에서 어떤 주요 강점과 약점이 있는가?
  • RQ3여러 모듈에 걸쳐 성과를 기반으로 볼 때, LLM이 컴퓨터공학 학위 과정을 통과할 수 있는 정도는 어느 정도인가?
  • RQ4수학적 추론 능력과 계산 정확도는 기술적 컴퓨터공학 분야에서 LLM의 성능에 어떤 영향을 미치는가?
  • RQ5LLM은 고등교육 분야에서 효과적인 교육 보조 수단이 될 수 있는가, 아니면 그 한계로 인해 유용성이 훼손되는가?

주요 결과

  • GPT-4.0는 6개 테스트 모듈에서 평균 80.2%의 점수를 기록하여 텍스트 기반 및 개념적 컴퓨터공학 과제에서 뛰어난 성능을 보였다.
  • ChatGPT-3.5는 10개 모듈에서 79.9%의 점수를 기록했으며, 10개 중 9개를 통과하여 비수학 분야에서 매우 높은 신뢰성을 보였다.
  • BingAI는 10개 모듈에서 68.4%의 점수를 기록했으며, 두 과목에서 실패했다. 특히 검색이 불가능하거나 맥락이 복잡한 질문에서 어려움을 겪었다.
  • LLaMA-65B-Q는 2개 모듈에서 평균 20.0%의 점수를 기록했으며, 제한된 능력을 보이며 어떤 과제도 올바르게 해결하지 못했다.
  • LLaMA-7B-Q는 6개 모듈에서 12.3%의 점수를 기록했고, 모든 과제에서 실패했으며, 맥락을 상실하거나 관련 없는 내용을 생성하는 경향이 있었다.
  • StableLM-7B는 최저 점수 10.8%를 기록했으며, 어떤 질문에도 정확히 대답하지 못했고, 비즈니스 맥락에서 질문을 자주 오해하는 경향이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.