[논문 리뷰] Towards LLM-based Autograding for Short Textual Answers
이 논문은 다양한 언어와 과목에서 자동으로 짧은 텍스트 답변을 채점하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 평가하며, LLMs가 신뢰성과 편향 문제로 인해 아직 인간의 감시 없이 완전히 자율적인 채점에 적합하지 않다는 점을 입증한다. 다만 LLMs는 보조적인 시각을 제공할 수 있으며, 교사들이 채점 절차를 검증하는 데 도움을 줄 수 있다.
Grading exams is an important, labor-intensive, subjective, repetitive, and frequently challenging task. The feasibility of autograding textual responses has greatly increased thanks to the availability of large language models (LLMs) such as ChatGPT and the substantial influx of data brought about by digitalization. However, entrusting AI models with decision-making roles raises ethical considerations, mainly stemming from potential biases and issues related to generating false information. Thus, in this manuscript, we provide an evaluation of a large language model for the purpose of autograding, while also highlighting how LLMs can support educators in validating their grading procedures. Our evaluation is targeted towards automatic short textual answers grading (ASAG), spanning various languages and examinations from two distinct courses. Our findings suggest that while "out-of-the-box" LLMs provide a valuable tool to provide a complementary perspective, their readiness for independent automated grading remains a work in progress, necessitating human oversight.
연구 동기 및 목표
- 교육 현장에서 짧은 텍스트 답변을 채점하기 위한 LLM의 타당성과 신뢰성 평가.
- 두 가지 다른 학술 과목에서 다양한 언어와 시험 유형에 걸쳐 LLM의 성능 평가.
- LLMs가 교사들이 자신의 채점 결정을 검증하거나 감사하는 데 어떻게 도움이 될 수 있는지 탐색.
- 자동 채점에 LLM을 도입할 경우 발생할 수 있는 주요 위험 요소—특히 편향과 환상(hallucination)—을 규명.
- 적절한 인간 감시 하에 LLM을 채점 워크플로에 통합하기 위한 근거 기반 권고 제시.
제안 방법
- 저자는 다국어를 다루는 대학 수준의 두 과목에서의 짧은 답변 응답에 대해 사전에 훈련된 LLM을 적용하여 채점.
- LLM이 일관되고 기준 점수에 부합하는 평가를 유도하기 위해 프롬프트 엔지니어링을 활용.
- 정확성과 일관성을 평가하기 위해 LLM의 점수를 인간이 채점한 기준과 비교.
- 정량적 지표(예: 인간 점수와의 상관관계)와 LLM의 추론에 대한 정성적 분석을 포함한 평가 수행.
- 다단계 프로세스를 사용: 프롬프트 설계, LLM 추론, 점수 집계, 인간이 채점한 기준과의 비교.
- 편향과 환상 등의 윤리적 고려사항은 LLM이 생성한 피드백 사례 연구를 통해 분석.
실험 결과
연구 질문
- RQ1LLMs는 짧은 텍스트 답변에 대해 인간이 채점한 기준과 얼마나 높은 상관관계를 보일 수 있는가?
- RQ2교육 평가에서 다양한 언어와 학문 분야에서 LLM의 성능은 어떻게 변화하는가?
- RQ3LLMs는 교사들이 자신의 채점 결정을 검증하거나 감사하는 데 어떤 방식으로 도움을 줄 수 있는가?
- RQ4자동 채점에 LLM을 사용할 경우 발생할 수 있는 주요 위험 요소(예: 편향 또는 환상)는 무엇인가?
- RQ5LLMs는 인간 채점자들을 대체하기보다는 지원하기 위해 채점 워크플로에 어떻게 통합될 수 있는가?
주요 결과
- LLMs는 인간 채점 점수와 중간에서 높은 상관관계를 보이며, 보조 채점 도구로의 잠재력을 확인.
- 언어 간 성능 격차가 뚜렷하게 나타나며, 영어 이외의 언어나 자원이 적은 언어에서는 정확도가 낮음.
- LLM은 때로는 신뢰할 수는 있지만 잘못된 피드백을 생성하여 환상과 편향의 위험을 드러냄.
- 오류 수정과 채점 결과의 공정성 및 일관성 확보를 위해 인간의 감시가 항상 필요함.
- LLMs는 교사들이 자신의 채점 패턴에서 일관성 없는 점을 발견하는 데 도움이 되는 유용한 피드백을 제공함.
- 이 연구는 '출시된 그대로의' LLM은 정교한 보정 없이도 독립적인 자동 채점에 신뢰할 수 없음을 발견함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.