[논문 리뷰] Happy Are Those Who Grade without Seeing: A Multi-Task Learning Approach to Grade Essays Using Gaze Behaviour
이 논문은 소수의 에세이에서 수집한 시선 행동 데이터를 활용하여, 대부분의 에세이에 대해 시선 데이터가 없더라도 자동 에세이 채점(AEG) 성능을 향상시키는 다중 작업 학습 프레임워크를 제안한다. 시선 패턴과 에세이 점수를 함께 학습함으로써, 볼 수 있는 및 볼 수 없는 에세이 세트 모두에서 통계적으로 유의미한 성능 향상을 달성하였으며, 이는 QWK(중량화된 편차 계수) 기준 최대 0.0137 향상으로, 시선 행동이 도메인 간으로도 일반화됨을 보여준다.
The gaze behaviour of a reader is helpful in solving several NLP tasks such as automatic essay grading. However, collecting gaze behaviour from readers is costly in terms of time and money. In this paper, we propose a way to improve automatic essay grading using gaze behaviour, which is learnt at run time using a multi-task learning framework. To demonstrate the efficacy of this multi-task learning based approach to automatic essay grading, we collect gaze behaviour for 48 essays across 4 essay sets, and learn gaze behaviour for the rest of the essays, numbering over 7000 essays. Using the learnt gaze behaviour, we can achieve a statistically significant improvement in performance over the state-of-the-art system for the essay sets where we have gaze data. We also achieve a statistically significant improvement for 4 other essay sets, numbering about 6000 essays, where we have no gaze behaviour data available. Our approach establishes that learning gaze behaviour improves automatic essay grading.
연구 동기 및 목표
- 자동 에세이 채점에 필요한 시선 행동 데이터 수집의 높은 비용 문제를 해결하기 위해 소수의 시드 세트에서 시선 패턴을 학습하는 것.
- 다중 작업 학습 프레임워크에서 시선 행동을 보조 작업으로 활용하여 AEG 성능을 향상시키는 것.
- 소수의 에세이에서 학습한 시선 행동 패턴이 시선 데이터가 전혀 없는 새로운 에세이 세트로 일반화되는지 평가하는 것.
- 향후 시선 보강된 NLP 작업 연구를 지원하기 위해 새로운 시선 행동 데이터셋과 코드를 공개하는 것.
제안 방법
- 눈동자 추적 장치를 사용하여 4개의 에세이 세트에서 총 48개의 에세이에서 시선 행동 데이터를 수집하며, 관심 영역, 정지 시선, 이동 시선(진행 및 후진)에 중점을 둔다.
- 체류 시간, 첫 번째 정지 시선 지속 시간, 후진 표시, 건너뛰기 횟수, 연속 횟수 등의 시선 행동 특징을 정의하여 입력 표현으로 사용한다.
- 공유 표현을 사용하여 에세이 점수 예측(주 작업)과 시선 행동 예측(보조 작업)을 동시에 최적화하는 다중 작업 학습 모델을 훈련한다.
- 동일한 모델 아키텍처를 사용하여, 시선 데이터가 없는 4개의 추가 에세이 세트에 약 7,000개의 에세이에 대해 학습된 시선 행동 패턴을 전이한다.
- 각 개별 시선 특징이 전체 성능에 기여하는 정도를 평가하기 위해 추상화 연구(ablation study)를 수행한다.
- 평가 지표로 QWK(중량화된 편차 계수)를 사용하여 기준 시스템(문자 커널 기반 모델)과 결과를 비교한다.
실험 결과
연구 질문
- RQ1소수의 에세이에서 학습한 시선 행동 패턴이 더 큰, 볼 수 없는 에세이 세트의 자동 에세이 채점 성능을 향상시킬 수 있는가?
- RQ2어느 시선 행동 특징이 에세이 점수 예측 성능 향상에 가장 크게 기여하는가?
- RQ3모국어가 영어인 사람의 시선 행동을 사용할 경우 비모국어 사용자 데이터를 사용하는 것보다 성능이 더 좋은가?
- RQ4다중 작업 학습 프레임워크가 다양한 에세이 주제와 도메인 간에 시선 행동 지식을 효과적으로 전이할 수 있는가?
주요 결과
- 제안된 다중 작업 학습 모델은 48개의 에세이에서 수집한 시선 데이터와 전이된 시선 행동 패턴을 모두 사용할 경우, 볼 수 없는 에세이 세트에서 평균 QWK 0.771을 기록하여 기준 시스템보다 유의미하게 높은 성능(유의수준 p < 0.05)을 달성하였다.
- 체류 시간과 첫 번째 정지 시선 지속 시간 특징이 가장 큰 기여를 하였으며, 각각 QWK 향상 0.0137 및 0.0136를 기록하였다.
- 모국어가 영어인 사람의 시선 행동만을 사용할 경우, 볼 수 있는 세트에서 평균 QWK 0.779, 볼 수 없는 세트에서 0.748를 기록하였으며, 시선 데이터 없이 사용할 경우보다 통계적으로 유의미한 향상(유의수준 p = 0.0084)을 보였다.
- 볼 수 없는 에세이 세트에서 통계적으로 유의미한 성능 향상이 이루어졌으며(p < 0.05), 이는 시선 행동 패턴이 도메인 간으로 일반화됨을 보여준다.
- 모든 시선 특징의 정규화된 평균 제곱오차(MSE)는 항상 0.125에서 0.128 사이로 유지되어 안정적이고 신뢰할 수 있는 특징 학습이 이루어졌음을 시사한다.
- 문자 커널 기반 시스템(QWK = 0.750, 볼 수 있는 세트에서)을 초월하여 성능을 냈으며, 볼 수 없는 세트에서 QWK 0.685를 기록하여 시선 보강 학습의 우수성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.