Skip to main content
QUICK REVIEW

[논문 리뷰] AI-assisted Automated Short Answer Grading of Handwritten University Level Mathematics Exams

Tianyi Liu, Julia Chatain|arXiv (Cornell University)|2024. 08. 21.
Intelligent Tutoring Systems and Adaptive Learning인용 수 4
한 줄 요약

이 논문은 대학 수준의 수학 시험에서 손글씨로 작성된 단답형 응답을 평가하기 위해 GPT-4의 효과성을 평가하며, 최소한의 프롬프트 엔지니어링으로도 신뢰할 수 있고 비용 효율적인 初기 평가를 제공하는 것으로 밝혀졌다. 손글씨 수학 표현을 인식하는 데에는 제한이 있지만, GPT-4는 의미적 이해와 등가성 탐지에서 뛰어난 성능을 보이며, 신뢰도 높은 신뢰도 추정 및 향상된 OCR 파이프라인과 결합할 경우 인간 평가자와의 협업에서 인공지능 보조자로서의 잠재력을 보여준다.

ABSTRACT

Effective and timely feedback in educational assessments is essential but labor-intensive, especially for complex tasks. Recent developments in automated feedback systems, ranging from deterministic response grading to the evaluation of semi-open and open-ended essays, have been facilitated by advances in machine learning. The emergence of pre-trained Large Language Models, such as GPT-4, offers promising new opportunities for efficiently processing diverse response types with minimal customization. This study evaluates the effectiveness of a pre-trained GPT-4 model in grading semi-open handwritten responses in a university-level mathematics exam. Our findings indicate that GPT-4 provides surprisingly reliable and cost-effective initial grading, subject to subsequent human verification. Future research should focus on refining grading rules and enhancing the extraction of handwritten responses to further leverage these technologies.

연구 동기 및 목표

  • 사전 훈련된 대규모 언어 모델(GPT-4 등)을 활용해 대학 수준의 수학 시험에서 손글씨로 작성된 단답형 응답을 평가하는 것이 가능한지 평가하는 것.
  • 다른 어휘나 표기 방식을 사용하더라도 수학적으로 동일한 답을 식별하는 데 있어 GPT-4의 신뢰성과 내구성에 대해 조사하는 것.
  • 확률 기반 기반법을 활용해 GPT-4의 평가 결정에 대한 신뢰도를 추정하는 방법을 개발하고 평가하는 것.
  • 손글씨 수식 인식 및 평가 기준 설정과 같은 문제를 포함해 고성과 평가에 AI를 통합하는 데 있어 주요 과제를 규명하는 것.
  • 인간이 개입하는 검증을 통해 정확도를 유지하면서도 인간의 평가 부담을 줄일 수 있는 실용적인 AI 보조 평가 파이프라인을 제안하는 것.

제안 방법

  • 실제 대학 시험의 여섯 개 단답형 수학 문제에 대한 학생 응답을 최소한의 프롬프트 엔지니어링을 통해 GPT-4로 평가.
  • 이중 단계 워크플로우를 활용: 먼저 Mathpix API를 통해 스캔하고 전체 시험지의 텍스트를 추출(OCR), 그 다음 LaTeX 및 파이썬 기반 파싱을 통해 응답 필드를 추출.
  • GPT-4의 평가 결정에 대한 신뢰도를 추정하기 위해 확률 이론 기반 접근법을 적용하여 불확실하거나 이질적인 예측을 식별.
  • 표준화된 평가 기준을 사용해 GPT-4의 출력을 인간 평가 결과와 비교 평가하며, 정확성과 등가성 탐지에 중점을 둠.
  • 모델의 행동과 오류 분석을 바탕으로 평가 프롬프트와 규칙를 반복적으로 개선.
  • 프롬프트의 문장 구조는 동일하게 유지하면서 다양한 어휘로 표현한 경우를 테스트하여 모델의 파라프라징에 대한 내구성 평가.

실험 결과

연구 질문

  • RQ1GPT-4는 최소한의 프롬프트 맞춤화로 손글씨 단답형 수학 응답을 신뢰성 있게 평가할 수 있는가?
  • RQ2다른 표기 방식을 사용하더라도 동일한 수학 개념을 파라프라징한 경우 GPT-4의 평가 성능는 얼마나 견고한가?
  • RQ3GPT-4의 성능은 특히 손글씨 수학 표현의 경우 OCR 전환 입력의 품질에 얼마나 의존하는가?
  • RQ4확률 기반의 신뢰도 추정 방법은 신뢰할 수 없는 또는 불확실한 AI 기반 평가 결과를 효과적으로 식별할 수 있는가?
  • RQ5대학 수학 평가에서 고성과 평가에 LLM을 구현할 때 주요 과제는 무엇인가?

주요 결과

  • GPT-4는 표기 방식의 다양성에도 불구하고 수학적으로 동일한 해답을 정확히 식별하는 데 높은 신뢰성을 보였다.
  • 프롬프트의 문장 구조가 동일할 경우, 다양한 표현 방식을 사용하더라도 GPT-4는 파라프라징에 대해 강력한 내구성을 보였다.
  • GPT-4의 성능은 손글씨 수학 표현의 정확도에 따라 크게 영향을 받았으며, 이는 입력 품질이 핵심적 한계 요소임을 시사한다.
  • 제안된 확률 기반의 신뢰도 추정 방법은 유망한 결과를 보였으며, 인간 검토를 위한 고위험 평가 결정 식별에 실용적인 길을 열었다.
  • 이 작업에 대해 미세조정을 하지 않았음에도 불구하고, GPT-4는 다섯 년 전의 전문화된 모델들을 뛰어넘는 성능을 보였으며, 일반 목적의 LLM이 교육 평가 분야에서의 잠재력을 보여주었다.
  • 본 연구는 LLM이 인간 검증과 결합할 경우 평가 워크플로우에서 효과적인 AI 보조자 역할을 할 수 있음을 확인했다. 이는 인간의 부담을 줄이고 정확도를 유지할 수 있음을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.