[논문 리뷰] What does ChatGPT know about natural science and engineering?
이 연구는 덴트 대학교의 교수가 수집한 594개 질문의 데이터셋을 사용하여 챗지피티의 자연과학 및 공학 분야 질문에 대한 성능을 실증적으로 평가한다. 결과적으로 챗지피티의 답변은 평균적으로 '다수 정확함'으로 평가되지만, 교육 수준이 높아질수록 성능이 크게 떨어지고, 사실 지식을 넘어서는 비판적 사고 능력 평가 시에도 성능 저하가 나타난다.
ChatGPT is a powerful language model from OpenAI that is arguably able to comprehend and generate text. ChatGPT is expected to have a large impact on society, research, and education. An essential step to understand ChatGPT's expected impact is to study its domain-specific answering capabilities. Here, we perform a systematic empirical assessment of its abilities to answer questions across the natural science and engineering domains. We collected 594 questions from 198 faculty members across 5 faculties at Delft University of Technology. After collecting the answers from ChatGPT, the participants assessed the quality of the answers using a systematic scheme. Our results show that the answers from ChatGPT are on average perceived as ``mostly correct''. Two major trends are that the rating of the ChatGPT answers significantly decreases (i) as the complexity level of the question increases and (ii) as we evaluate skills beyond scientific knowledge, e.g., critical attitude.
연구 동기 및 목표
- 자연과학 및 공학 분야에서 챗지피티의 사실 정확성과 추론 품질을 평가하기 위해.
- 질문의 교육 수준이 챗지피티의 답변에 대한 정확도 평가에 미치는 영향을 조사하기 위해.
- 챗지피티가 암기 지식을 넘어서 비판적 사고 및 과학적 판단과 같은 능력을 효과적으로 보여줄 수 있는지 평가하기 위해.
- STEM 교육 및 연구 맥락에서 대규모 언어 모델(LM) 능력을 체계적이고 교수가 검증한 기준으로 제공하기 위해.
제안 방법
- 델프트 과학기술대학교의 다섯 개 faculty 소속 198명의 교수가 제안한 도메인 전문 질문 594개를 수집하였다.
- 챗지피티(GPT-3.5-turbo)에 질문을 제출하고 그에 대한 응답을 수집하여 분석하였다.
- 교수가 표준화된 척도를 사용해 각 응답의 품질을 평가하는 구조화된 평가 체계를 도입하였다.
- 사실 정확성, 논리성, 비판적 사고 능력의 발휘 등 차원에서 평가 결과를 분석하였다.
- 질문의 난이도와 요구되는 인지 능력에 따라 성능 추세를 분석하기 위해 통계적 방법을 사용하였다.
- 분야 전문가들의 피어 리뷰 및 반복 피드백을 통해 결과를 검증하였다.
실험 결과
연구 질문
- RQ1자연과학 및 공학 분야 질문에 대해 챗지피티의 정확도는 다양한 학문 수준에서 어떻게 평가되는가?
- RQ2질문의 교육 수준이 높아질수록 챗지피티의 답변에 대한 평가 품질이 떨어지는가?
- RQ3챗지피티는 사실 기억을 넘어서 비판적 사고 및 과학적 추론 능력을 어느 정도 발휘할 수 있는가?
- RQ4교수 전문가들은 챗지피티의 답변이 STEM 맥락에서 전반적으로 신뢰성 있고 유용한가로 평가하는가?
- RQ5자연과학 및 공학 분야 내에서 챗지피티가 특히 잘하거나 못하는 특정 분야가 존재하는가?
주요 결과
- 교수 평가자들에 따르면 챗지피티의 답변은 평균적으로 '다수 정확함'으로 평가되었다.
- 질문의 교육 수준이 높아질수록 답변 품질이 뚜렷이 저하되었으며, 특히 고급 학문 수준에서 두드러졌다.
- 비판적 사고, 과학적 판단, 개념적 추론과 같은 능력 평가 시 성능 저하가 뚜렷하게 나타났다.
- 입문 수준 질문에서는 사실 기억 능력이 뛰어났지만, 뉴앙스 있는 고차원 추론 과제에서는 어려움을 겪었다.
- 공학 및 고급 물리학 질문에서는 사실 정확한 답변이라도 신뢰성이 일관되지 않았다.
- 교수 평가자들은 잘못된 답변에 대해 과도하게 자신감을 보이고 지식의 한계를 인식하지 못하는 점을 우려하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.