Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Scoring for Reading Comprehension via In-context BERT Tuning

Nigel Fernandez, Aritra Ghosh|arXiv (Cornell University)|2022. 05. 19.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 구조화된 입력 프롬프트를 통해 항목별 맥락을 통합하는 공유 모델을 사용하여 독해력 응답의 자동 평가를 위한 인-컨텍스트 BERT 미세조정을 제안한다. 공통된 본문 및 질문 맥락을 활용함으로써 NAEP 챌린지에서 최신 기술 성능을 달성하며, 별도의 모델을 사용하지 않는 라ン게이지 모델(LM) 기반 및 비-LM 기반 베이스라인을 모두 능가한다. 또한 약간의 인구통계적 편향을 보여준다.

ABSTRACT

Automated scoring of open-ended student responses has the potential to significantly reduce human grader effort. Recent advances in automated scoring often leverage textual representations based on pre-trained language models such as BERT and GPT as input to scoring models. Most existing approaches train a separate model for each item/question, which is suitable for scenarios such as essay scoring where items can be quite different from one another. However, these approaches have two limitations: 1) they fail to leverage item linkage for scenarios such as reading comprehension where multiple items may share a reading passage; 2) they are not scalable since storing one model per item becomes difficult when models have a large number of parameters. In this paper, we report our (grand prize-winning) solution to the National Assessment of Education Progress (NAEP) automated scoring challenge for reading comprehension. Our approach, in-context BERT fine-tuning, produces a single shared scoring model for all items with a carefully-designed input structure to provide contextual information on each item. We demonstrate the effectiveness of our approach via local evaluations using the training dataset provided by the challenge. We also discuss the biases, common error types, and limitations of our approach.

연구 동기 및 목표

  • 각 항목마다 별도의 모델을 훈련하는 방식으로 인해 발생하는 확장성 및 맥락 활용의 한계를 해결하기 위해.
  • 독해력 평가를 위한 통합적이고 확장 가능한 모델을 개발하여 항목 간 공통된 본문 및 질문 맥락을 활용하기 위해.
  • 각 항목에 대해 별도의 모델이 필요 없이 인-컨텍스트 미세조정이 가능한 맥락 풍부한 입력 형식을 설계함으로써 평가 정확도를 향상시키기 위해.
  • 실제 교육 평가 환경에서 모델의 성능, 오류 패턴, 다양한 인구통계적 집단 간 공정성에 대해 평가하기 위해.

제안 방법

  • 각 항목에 대해 본문, 질문, 예시 응답 및 그 점수를 포함한 프롬프트를 구성함으로써 사전 훈련된 BERT 모델의 인-컨텍스트 미세조정을 수행한다.
  • 구조화된 입력 형식을 사용해 각 대상 응답에 대한 맥락 정보를 통합함으로써, 모든 항목에 동시에 공유되는 BERT 모델을 미세조정한다.
  • 입력 형식은 질문, 몇 개의 인-컨텍스트 예시(정답 점수 포함), 그리고 학생의 응답을 모두 하나의 시퀀스로 연결하여 BERT에 입력한다.
  • 모델은 이러한 맥락 풍부한 입력을 기반으로 학생 응답의 인간 평가 점수를 예측하도록 훈련되어, 새로운 항목에 대해 제로샷 일반화가 가능하다.
  • 공정성 분석을 위해 성별, 민족 등 인구통계 정보를 프롬프트의 접두어로 선택적으로 포함할 수 있으며, 예를 들어 "여자 아시아계 학생이 작성한 이 답변을 평가해 주세요"와 같이 입력할 수 있다.
  • 정확도 향상을 위해 사후 철자 검사 단계를 적용하고, 모델의 해석 가능성 분석을 위해 어텐션 맵을 활용한다.

실험 결과

연구 질문

  • RQ1각 항목에 대해 별도의 미세조정 없이도 하나의 공유 BERT 모델이 여러 독해력 항목에서 높은 평가 정확도를 달성할 수 있는가?
  • RQ2구조화된 프롬프트를 통한 인-컨텍스트 미세조정은 항목별 맥락을 효과적으로 포착하면서도 항목 간 파라미터 공유를 어떻게 달성하는가?
  • RQ3모델이 자주 범하는 오류 유형은 무엇이며, 문법, 주관성, 공호성 등 언어적 특성과 어떤 관련이 있는가?
  • RQ4모델은 다양한 학생 인구통계 집단에 대해 어느 정도 편향을 보이며, 입력에 인구통계 정보를 포함시키면 공정성에 어떤 영향을 미치는가?
  • RQ5모델은 본문 전부에 접근하지 못한 상태에서도 새로운 항목으로 일반화할 수 있는가? 이는 독해력 능력에 어떤 영향을 미치는가?

주요 결과

  • 제안된 인-컨텍스트 BERT 미세조정 방법은 NAEP 훈련 데이터셋에서 기존의 LM 기반 및 비-LM 기반 자동 평가 베이스라인을 모두 능가한다.
  • 각 항목에 대해 별도의 모델이 필요 없이도 높은 정확도를 달성함으로써 확장성 향상과 스토리지 요구량 감소에 기여한다.
  • 흔히 발생하는 오류 유형으로는 철자/문법 오류, 주관적 해석, 희귀한 정답, 잘못된 응답을 모방한 경우 등이 있으며, 특히 저점수 예시를 모방하는 경우에 더 높은 오류 발생률을 보인다.
  • 모델는 약간의 편향을 보이며, 대부분의 인구통계 집단에 대해 점수를 과도하게 평가하는 경향이 있으나, 특히 4학년에서 패시픽 아일랜더/아메리칸 인디언 집단은 훈련 데이터 수가 적어 이에 해당하지 않는다.
  • 입력 프롬프트에 인구통계 정보를 포함시키면 편향 패턴이 약간 변화하지만, 여전히 모든 집단에서 피할 수 없는 소규모 편향이 존재한다.
  • 철자 검사 전처리를 통해 평가 정확도가 향상되었으며, 고정된 텍스트 인코더로만 BERT를 사용하는 것보다 미세조정을 통해 훨씬 더 효과적인 성능 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.