Skip to main content
QUICK REVIEW

[논문 리뷰] CompLex: A New Corpus for Lexical Complexity Prediction from Likert Scale Data

Matthew Shardlow, M. Cooper|arXiv (Cornell University)|2020. 03. 16.
Text Readability and Simplification참고 문헌 13인용 수 33
한 줄 요약

CompLex는 Bible, Europarl, 및 생물의학 텍스트를 대상으로 5점 리커트 척도에 의한 연속적 어휘 복잡도 예측을 위한 최초의 영어 코퍼스를 제공합니다. 베이스라인 예측은 MAE에서 유망한 결과를 보여줍니다.

ABSTRACT

Predicting which words are considered hard to understand for a given target population is a vital step in many NLP applications such as text simplification. This task is commonly referred to as Complex Word Identification (CWI). With a few exceptions, previous studies have approached the task as a binary classification task in which systems predict a complexity value (complex vs. non-complex) for a set of target words in a text. This choice is motivated by the fact that all CWI datasets compiled so far have been annotated using a binary annotation scheme. Our paper addresses this limitation by presenting the first English dataset for continuous lexical complexity prediction. We use a 5-point Likert scale scheme to annotate complex words in texts from three sources/domains: the Bible, Europarl, and biomedical texts. This resulted in a corpus of 9,476 sentences each annotated by around 7 annotators.

연구 동기 및 목표

  • Lexical complexity prediction를 이진 분류가 아닌 연속적 작업으로 동기를 부여한다.
  • Likert 척도 복잡도 점수로 주석된 다양한 영어 코퍼스를 생성한다.
  • 주석 품질과 어휘적 복잡도에서 장르 간 차이를 분석한다.
  • 연속적 복잡도 예측의 가능성을 확보하기 위한 베이스라인 예측 모델을 제공한다.

제안 방법

  • 어휘 복잡도에 대한 5점 Likert 척도 주석 체계(1=Very Easy to 5=Very Difficult) 개발.
  • Bible, Europarl, 및 biomedical 도메인에서 9,476개의 문장을 수집하고 대상(단어 및 MWEs)을 크라우드소싱으로 주석화한다.
  • 주석을 0–1로 정규화된 복잡도 점수로 집계(1->0, 2->0.25, 3->0.5, 4->0.75, 5->1).
  • 인스턴스당 20개의 주석을 사용하고 품질 관리 및 참여가 불충분한 주석은 버리되 유효 주석을 최소 4개 이상 유지한다.
  • 다음의 특징을 혼합한 기본 선형 회귀를 학습한다: 300차원 GloVe 단어 임베딩, 4,096차원 InferSent 컨텍스트 임베딩, 수동 제작된 특징(빈도, 길이, 음절 수).
  • held-out 10% 테스트 세트에서 평가하고 평균 절대 오류(MAE)를 보고한다.

실험 결과

연구 질문

  • RQ1어휘 복잡도를 이진 레이블이 아니라 연속 속성으로 효과적으로 모델링할 수 있는가?
  • RQ2도메인 장르(Bible, Europarl, Biomed)는 어휘 복잡도 및 모델링 가능성에 어떤 차이를 보이는가?
  • RQ3LCP에 있어 단어 수준 임베딩 versus 컨텍스트 임베딩 및 수동 특징의 예측 가치는 무엇인가?
  • RQ4다중 단어 표현(MWEs)이 도메인 간 단어 하나보다 복잡도에서 다른가?
  • RQ5표준 어휘 특징과 임베딩을 사용한 CompLex에서 선형 모델이 얻을 수 있는 기본 성능은 어느 정도인가?

주요 결과

  • 코퍼스는 9,476개의 문장을 포함하며 평균 복잡도는 약 0.395(표준편차 0.115)이다.
  • 단어 하나의 평균 복잡도는 0.385이고 MWEs의 평균은 0.444이며 도메인 차이(Biomed의 더 높은 복잡도)가 있다.
  • 핸드크래프트 특징을 사용한 기본 선형 회귀는 최상의 설정에서 MAE 0.0853을 달성했다.
  • 단어 임베딩만으로는 MAE 0.0875를 달성하여 핸드크래프트 특징과 유사한 성능을 보였고 문장 임베딩은 예측력이 낮았다(MAE 개선 없음).
  • Europarl은 Bible(0.6648) 및 Biomed(0.2954)보다 일반적으로 낮은 MAE(0.0801)를 보여 도메인 특이적 예측 가능성을 시사한다.
  • 맥락 임베딩은 이 기본 설정에서 일관되게 예측력을 높이지 못해 대안 모델에서의 잠재적 이 gains가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.