Skip to main content
QUICK REVIEW

[논문 리뷰] ChatGPT & Mechanical Engineering: Examining performance on the FE Mechanical Engineering and Undergraduate Exams

Matthew Frenkel, Hebah Emara|arXiv (Cornell University)|2023. 09. 26.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 연구는 기계공학 시험, 특히 FE 기계공학 및 학부 3학년/4학년 수준의 시험에서 ChatGPT의 성능을 평가한다. GPT-3.5(무료)와 GPT-4(유료)를 사용하여 분석한 결과, GPT-4는 정확도 76%를 기록한 반면 GPT-3.5는 51%에 머물렀다. 그러나 두 모델 모두 텍스트 입력만을 사용하고 잘못된 답변에 대해 과도하게 자신감을 갖는다는 점에서 실용적 사용에 한계가 있으며, 전문가의 감시 없이는 실제 응용에 어려움이 있다.

ABSTRACT

The launch of ChatGPT at the end of 2022 generated large interest into possible applications of artificial intelligence in STEM education and among STEM professions. As a result many questions surrounding the capabilities of generative AI tools inside and outside of the classroom have been raised and are starting to be explored. This study examines the capabilities of ChatGPT within the discipline of mechanical engineering. It aims to examine use cases and pitfalls of such a technology in the classroom and professional settings. ChatGPT was presented with a set of questions from junior and senior level mechanical engineering exams provided at a large private university, as well as a set of practice questions for the Fundamentals of Engineering Exam (FE) in Mechanical Engineering. The responses of two ChatGPT models, one free to use and one paid subscription, were analyzed. The paper found that the subscription model (GPT-4) greatly outperformed the free version (GPT-3.5), achieving 76% correct vs 51% correct, but the limitation of text only input on both models makes neither likely to pass the FE exam. The results confirm findings in the literature with regards to types of errors and pitfalls made by ChatGPT. It was found that due to its inconsistency and a tendency to confidently produce incorrect answers the tool is best suited for users with expert knowledge.

연구 동기 및 목표

  • 표준화된 기계공학 시험과 학술 기계공학 시험에서 ChatGPT 모델의 성능을 평가하기 위해.
  • 무료인 GPT-3.5와 유료인 GPT-4의 기계공학 문제 해결 능력을 비교하기 위해.
  • STEM 분야 응용 분야에서 생성형 AI 출력물의 일반적인 오류 패턴과 신뢰성 문제를 규명하기 위해.
  • 학술적 및 전문적인 기계공학 환경에서 ChatGPT의 사용 적합성을 평가하기 위해.

제안 방법

  • 대규모 사립대학교의 기계공학 전공 3학년 및 4학년 수준 과정에서 출제된 문제들을 GPT-3.5와 GPT-4에 모두 제공하였다.
  • 다중선택형 및 문제 해결 유형을 포함한 동일한 문제 세트에 대해 두 모델의 응답을 수집하였다.
  • 정답 키와 비교하여 응답의 정확도와 일관성을 평가하였다.
  • 사실 오류, 논리적 오류, 잘못된 답변에 대한 과도한 자신감 등 오류 유형을 분석하였다.
  • 질적 및 양적 분석을 통해 문제 유형과 난이도 수준에 따라 모델 간 성능을 비교하였다.
  • 텍스트 입력만으로 이루어지는 제약 조건과 그가 FE 기계공학 시험 준비도에 미치는 영향을 비교 분석하였다.

실험 결과

연구 질문

  • RQ1ChatGPT(GPT-3.5 및 GPT-4)는 학부 기계공학 시험 문제를 얼마나 정확하게 해결하는가?
  • RQ2ChatGPT는 기계공학 문제를 해결할 때 일반적으로 어떤 오류를 범하는가?
  • RQ3GPT-4는 기계공학 시험 문제에서 GPT-3.5에 비해 얼마나 더 우수한 성능을 보이는가?
  • RQ4학술적 또는 전문적인 기계공학 환경에서 ChatGPT의 응답은 어느 정도 신뢰할 수 있는가?
  • RQ5FE 기계공학 시험 준비도 평가에서 텍스트 입력만으로 제한될 경우 ChatGPT의 한계는 무엇인가?

주요 결과

  • GPT-4는 테스트된 기계공학 시험 문제에서 76%의 정확도를 기록하여 GPT-3.5를 크게 앞섰다.
  • GPT-3.5는 51%의 정확도를 기록하여 복잡한 공학 문제 해결에 있어 신뢰성이 떨어지는 것으로 나타났다.
  • 두 모델 모두 다단계 또는 맥락에 민감한 문제에서 잘못된 답변에 대해 과도하게 자신감을 갖는 경향을 보였다.
  • 다중모달 입력(예: 다이어그램, 수식을 이미지 형태로 제공)이 부족하여 성능에 심각한 영향을 미쳤으며, 특히 FE 기계공학 시험에서 두드러졌다.
  • 오류 패턴으로는 문제 맥락의 오해석, 공식의 잘못된 적용, 추론 과정에서의 논리적 모순이 포함되었다.
  • 높은 자신감을 보였음에도 불구하고, 텍스트 입력 제약 조건과 오류의 누적으로 인해 두 모델 모두 FE 기계공학 시험에 합격할 가능성이 높지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.