Skip to main content
QUICK REVIEW

[논문 리뷰] My Teacher Thinks The World Is Flat! Interpreting Automatic Essay Scoring Mechanism

Swapnil Parekh, Yaman Kumar|arXiv (Cornell University)|2020. 12. 27.
Topic Modeling참고 문헌 20인용 수 7
한 줄 요약

이 논문은 통합 기울기(gradient)를 사용하여 단어 수준의 기여도를 분석함으로써 딥러닝 기반 자동 에세이 채점(AES) 모델의 해석 가능성(interpretability)을 조사한다. 연구 결과, AES 모델는 에세이를 '단어의 스프레드'로 간주하며, 문맥, 순서, 일관성과는 무관하게 오직 일부 고기여도 단어들(예: SkipFlow의 경우 31%, Memory Network의 경우 51%)만이 점수를 결정함을 드러낸다. 이러한 모델들은 '지구는 평평하다'와 같은 잘못된 사실을 삽입하는 적대적 편향(adversarial perturbations)에 취약하며, 의미적 이해가 아닌 고립된 키워드에 의존하기 때문에 점수가 상승할 수 있다.

ABSTRACT

Significant progress has been made in deep-learning based Automatic Essay Scoring (AES) systems in the past two decades. However, little research has been put to understand and interpret the black-box nature of these deep-learning based scoring models. Recent work shows that automated scoring systems are prone to even common-sense adversarial samples. Their lack of natural language understanding capability raises questions on the models being actively used by millions of candidates for life-changing decisions. With scoring being a highly multi-modal task, it becomes imperative for scoring models to be validated and tested on all these modalities. We utilize recent advances in interpretability to find the extent to which features such as coherence, content and relevance are important for automated scoring mechanisms and why they are susceptible to adversarial samples. We find that the systems tested consider essays not as a piece of prose having the characteristics of natural flow of speech and grammatical structure, but as `word-soups' where a few words are much more important than the other words. Removing the context surrounding those few important words causes the prose to lose the flow of speech and grammar, however has little impact on the predicted score. We also find that since the models are not semantically grounded with world-knowledge and common sense, adding false facts such as ``the world is flat'' actually increases the score instead of decreasing it.

연구 동기 및 목표

  • 최신 딥러닝 기반 AES 모델의 블랙박스 채점 메커니즘을 이해하기 위해.
  • 이러한 모델이 의미적으로 일관성 없거나 사실 오류가 있는 에세이에도 높은 점수를 부여하는 이유를 조사하기 위해.
  • 일관성, 내용, 관련성, 사실 정확성과 같은 언어적 특징이 자동 채점에 미치는 역할을 평가하기 위해.
  • 단어 수준의 중요도는 유지하되 의미와 구조를 손상시키는 적대적 편향에 대해 AES 모델의 강건성(robustness)을 평가하기 위해.
  • 모델의 해석 가능성 해석을 활용해 더 효과적인 테스트를 위한 적대적 편향 기법을 개선하기 위해.

제안 방법

  • 저자는 통합 기울기를 사용하여 단어 수준의 민감도 맵(saliency maps)를 계산하고, 주어진 에세이의 예측 점수에 가장 영향을 미치는 단어들을 특정한다.
  • 고기여도 단어들을 제거하거나 순서를 재배치함으로써 모델의 강건성을 평가하며, 점수 유지 시에도 문맥과 어순에 민감하지 않음을 입증한다.
  • 가짜 사실 문장을 삽입(예: '지구는 평평하다')하고 점수 변화를 측정함으로써 적대적 테스트를 수행한다.
  • SkipFlow(일관성 기반)와 Memory Network(최신 기술 기반) 두 가지 최신 모델의 편향에 대한 점수 안정성 측면에서 성능을 비교한다.
  • 기여도 점수 기반으로 20%의 단어를 제거하는 것과 무작위 삭제를 비교하여, 기여도 기반 제거가 예측 점수에 거의 영향을 주지 않는다는 것을 보여준다.
  • 어휘 난이도의 영향을 분석하여, 'legerdemain'이나 'propinquity'와 같은 희귀하고 난이도 높은 단어들이 보상받기보다는 오히려 감점됨을 발견한다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 AES 모델은 에세이 내 개별 단어에 대해 어떻게 중요도를 할당하는가?
  • RQ2왜 AES 모델은 '지구는 평평하다'와 같은 잘못된 사실이 포함된 에세이에도 높은 점수를 매기는가?
  • RQ3모델의 예측이 단어 순서, 문맥, 또는 의미적 일관성에 얼마나 의존하는가?
  • RQ4기여도 기반 편향과 무작위 편향은 예측 점수 유지 측면에서 어떻게 비교되는가?
  • RQ5희귀하거나 난이도 높은 어휘 항목은 현대 AES 모델의 채점 메커니즘에서 어떤 역할을 하는가?

주요 결과

  • SkipFlow 모델는 통합 기울기로 특정된 가장 중요한 단어들만을 사용하여 원래의 에세이 점수를 재현할 수 있다. 이때 사용된 단어 비율은 31%이다.
  • Memory Network 기반 모델는 기여도가 가장 높은 단어들 중 51%만으로도 원래의 점수를 유지할 수 있으며, 이는 소수의 핵심 키워드에 강하게 의존하고 있음을 시사한다.
  • 고기여도 단어들의 문맥을 제거해도 예측 점수에 거의 영향을 주지 않으며, 이는 모델가 의미적 또는 문법적 구조를 이해하지 못하고 있음을 나타낸다.
  • 가장 기여도가 높은 단어들의 순서를 재배치해도 예측 점수에 큰 변화가 없으며, 이는 단어 순서가 중요하지 않은 '단어의 스프레드' 행동을 확인한다.
  • 예를 들어 '지구는 평평하다'와 같은 잘못된 사실 문장을 삽입하면 예측 점수가 상승하며, 이는 모델가 세계 지식이나 의미적 진실에 기반하지 않음을 시사한다.
  • 희귀하고 빈도가 낮은 단어들인 'legerdemain'과 'propinquity'는 보상받기보다는 오히려 감점됨을 확인하여, AES 모델가 희귀 어휘를 선호한다는 주장과 모순된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.