Skip to main content
QUICK REVIEW

[논문 리뷰] Short Answer Grading Using One-shot Prompting and Text Similarity Scoring Model

Su‐Youn Yoon|arXiv (Cornell University)|2023. 05. 29.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 GPT-3.5를 사용한 one-shot prompting과 미세조정된 Sentence-BERT(SBERT) 모델을 활용해, 한 질문당 수동으로 평가된 답안이 16개뿐인 저자원 환경에서도 분석 점수와 하위질문에 대한 정당화 키를 예측하는 저자원 자동 단답형 채점 모델을 제안한다. 이 방법은 공개된 ASAG 데이터셋에서 67%의 정확도와 0.71의 2차 가중 카파를 기록하며 다수 지배 기반 보다 유의하게 뛰어난 성능을 보이며, 정당화 키 검출 정확도는 90.3%에 이르렀다.

ABSTRACT

In this study, we developed an automated short answer grading (ASAG) model that provided both analytic scores and final holistic scores. Short answer items typically consist of multiple sub-questions, and providing an analytic score and the text span relevant to each sub-question can increase the interpretability of the automated scores. Furthermore, they can be used to generate actionable feedback for students. Despite these advantages, most studies have focused on predicting only holistic scores due to the difficulty in constructing dataset with manual annotations. To address this difficulty, we used large language model (LLM)-based one-shot prompting and a text similarity scoring model with domain adaptation using small manually annotated dataset. The accuracy and quadratic weighted kappa of our model were 0.67 and 0.71 on a subset of the publicly available ASAG dataset. The model achieved a substantial improvement over the majority baseline.

연구 동기 및 목표

  • 대규모 레이블링된 데이터셋이 확보되지 않은 저자원 자동 단답형 채점(ASAG) 문제에 도전한다.
  • 하위질문에 대한 분석 점수와 정당화 키를 함께 예측함으로써 자동 채점의 해석 가능성성을 향상시킨다.
  • 각 채점 기준에 해당하는 텍스트 스냅샷을 식별함으로써 실질적인 피드백 생성을 가능하게 한다.
  • 대규모 언어모델(LLM)과 도메인 적응형 텍스트 유사도 채점 기법을 활용해 소수의 샘플 학습을 통해 레이블링 비용을 절감한다.
  • 특히 하위질문 수준의 채점에서 LLM 기반 one-shot prompting의 저자원 환경에서의 타당성을 평가한다.

제안 방법

  • 완전한 미세조정 없이도 소수의 샘플 추론이 가능한, 룰 기반으로 생성된 기준 답변을 제공하기 위해 GPT-3.5를 one-shot prompting 방식으로 활용한다.
  • 학생의 답변과 기준 답변 간의 의미 유사도를 측정하기 위해 소규모 수동 레이블링 데이터셋에 대해 미세조정된 Sentence-BERT(SBERT) 모델을 적용한다.
  • 소규모 레이블링된 데이터셋을 활용해 SBERT 모델에 도메인 적응을 적용하여 목표 ASAG 작업에서의 성능을 향상시킨다.
  • SBERT 임베딩 기반으로 기준 답변과 가장 유사한 학생 답변의 스냅샷을 식별하는 규칙 기반 방법을 사용해 정당화 키를 추출한다.
  • SBERT의 유사도 점수를 기반으로 임계값 기반 또는 회귀 기반 접근법을 통해 분석 점수를 할당한다.
  • LLM를 통해 기준 답변을 증강함으로써 기준 집합의 다양성을 향상시키고, 저자원 환경에서의 안정성을 높인다.

실험 결과

연구 질문

  • RQ1LLM를 활용한 one-shot prompting이 최소한의 인간 입력으로 단답형 채점에 적합한 기준 답변을 효과적으로 생성할 수 있는가?
  • RQ2SBERT의 도메인 적응은 저자원 ASAG 환경에서 성능 향상에 어떤 영향을 미치는가?
  • RQ3기준 답변 증강이 정당화 키 검출 정확도와 최종 채점 정확도에 어떤 영향을 미치는가?
  • RQ4시스템이 수동 레이블링과 비교해 정당화 키 검출 정확도는 얼마나 되는가?
  • RQ5분석 점수와 정당화 키를 동시에 예측하는 방식이 저자원 환경에서의 전체 ASAG 성능 향상에 기여하는가?

주요 결과

  • one-shot + SBERT 모델은 ASAG 데이터셋에서 67%의 정확도와 0.71의 2차 가중 카파를 기록하였으며, 다수 지배 기반 대비 상대 오차를 27% 감소시켰다.
  • 정당화 키 검출 정확도는 90.3%에 이르렀으며, 216건 중 195건에서 시스템 생성 키가 수동 레이블링과 최소 90% 이상 겹쳤다.
  • 절단 실험 결과 도메인 적응이 성능 향상에 가장 큰 기여를 했으며, 도메인 적응이 적용된 상태에서 기준 답변 증강은 미미한 영향을 미쳤다.
  • 기본 SBERT 모델(정확도: 0.44)과 기준 답변 증강 모델(정확도: 0.52)보다도 성능이 뛰어나, 도메인 적응의 중요성을 입증했다.
  • 질문당 단지 16개의 수동 평가된 답변만으로도 기준 모델의 학습 데이터의 5% 미만으로도 상당한 성능 향상을 달성했다.
  • 강력한 성능를 보였음에도 불구하고 여전히 인간 수준의 성능에 크게 뒤져 있어, 실질적 도입에 앞서 향상 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.