Skip to main content
QUICK REVIEW

[논문 리뷰] Distilling ChatGPT for Explainable Automated Student Answer Assessment

Jiazheng Li, Lin Gui|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 설명 가능한 자동 학생 답변 평가를 위해 대규모 언어 모델인 ChatGPT의 추론 생성 능력을 더 작은 효율적인 언어 모델에 흡수하는 AERA 프레임워크를 제안한다. 정교화된 템플릿으로 ChatGPT를 프롬프팅하고 추론 보완 기법을 적용함으로써, ChatGPT보다도 QWK(2차 가중 캐피타니제이션) 기준으로 11% 향상된 성능을 달성하면서도 인간 평가 기준으로 유사한 수준의 추론을 생성한다.

ABSTRACT

Providing explainable and faithful feedback is crucial for automated student answer assessment. In this paper, we introduce a novel framework that explores using ChatGPT, a cutting-edge large language model, for the concurrent tasks of student answer scoring and rationale generation. We identify the appropriate instructions by prompting ChatGPT with different templates to collect the rationales, where inconsistent rationales are refined to align with marking standards. The refined ChatGPT outputs enable us to fine-tune a smaller language model that simultaneously assesses student answers and provides rationales. Extensive experiments on the benchmark dataset show that the proposed method improves the overall QWK score by 11% compared to ChatGPT. Furthermore, our thorough analysis and human evaluation demonstrate that the rationales generated by our proposed method are comparable to those of ChatGPT. Our approach provides a viable solution to achieve explainable automated assessment in education. Code available at https://github.com/lijiazheng99/aera.

연구 동기 및 목표

  • 대규모 언어 모델을 활용한 설명 가능한 자동 학생 답변 평가 프레임워크 개발
  • 기존 학생 평가 데이터셋에서 추론 애너테이션의 부족 문제를 해결하기 위해 ChatGPT의 추론 능력을 활용
  • 평가 결정을 정당화하는 자연어 추론을 생성함으로써 모델의 해석 가능성 향상
  • ChatGPT의 추론 능력을 더 작은 효율적인 언어 모델로 흡수하여 실용적 구현 가능하게 만들기
  • 인간 평가 및 벤치마크 비교를 통해 생성된 추론의 품질 검증

제안 방법

  • 학생 답변에 대해 ChatGPT의 추론 생성을 유도하기 위한 다양한 프롬프트 템플릿 설계
  • 일관성 없거나 품질이 낮은 추론을 보완하기 위해 추론 보완 모듈 적용, 평가 기준에 맞게 정렬
  • 보완된 추론-점수 쌍을 기반으로 작은 언어 모델을 피팅하여 동시에 점수 산정과 추론 생성 기능 수행
  • 흡수 전 ChatGPT의 추론 일관성과 충실도를 향상시키기 위해 이중 단계 프롬프팅 전략 적용
  • 추론 정확도에 대한 자동 평가 지표가 없기 때문에 인간 평가를 통해 추론 품질 평가
  • 흡수 모델을 종합적으로 훈련하여 동시에 점수 산정과 추론 생성 기능 수행

실험 결과

연구 질문

  • RQ1ChatGPT와 같은 대규모 언어 모델이 추가적인 인간 애너테이션된 추론 데이터 없이도 학생 답변 평가에 대해 고품질의 추론을 생성할 수 있는가?
  • RQ2LLM에서 유도된 일관성 없거나 정밀도가 낮은 추론을 어떻게 체계적으로 보완하여 공식 평가 기준에 맞출 수 있는가?
  • RQ3더 작은 흡수된 언어 모델이 원본 LLM(예: ChatGPT)보다 점수 정확도와 추론 품질 측면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ4흡수된 모델이 생성한 추론이 명료성, 관련성, 충실도 측면에서 인간 애너테이션된 추론과 얼마나 유사한가?
  • RQ5흡수 프레임워크는 성능을 유지하면서도 경량화되고 구현 가능한 모델을 효과적으로 생성하는가?

주요 결과

  • 제안된 AERA 프레임워크는 ChatGPT를 직접 사용하는 것보다 전체 QWK 점수를 11% 향상시켰다.
  • 흡수된 작은 언어 모델은 성능 측면에서 ChatGPT를 초월했으며, 인간 평가 결과 ChatGPT와 유사한 수준의 추론 품질을 제공했다.
  • 추론 보완 전략은 ChatGPT가 생성한 추론의 일관성과 공식 평가 기준에 대한 부합도를 크게 향상시켰다.
  • 인간 평가자들은 흡수된 모델이 생성한 추론을 높은 신뢰성과 해석 가능성으로 평가했으며, ChatGPT와 비교해 품질 저하가 없었다.
  • 이 프레임워크는 비용이 많이 드는 인간 애너테이션된 추론 데이터 없이도 고품질의 설명 가능한 자동 평가를 가능하게 한다.
  • 이러한 접근은 ChatGPT와 같은 강력한 LLM에서 흡수함으로써 작고 효율적이며 효과적인 교육 평가 모델을 도출할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.