Skip to main content
QUICK REVIEW

[論文レビュー] CompLex: A New Corpus for Lexical Complexity Prediction from Likert Scale Data

Matthew Shardlow, M. Cooper|arXiv (Cornell University)|Mar 16, 2020
Text Readability and Simplification参考文献 13被引用数 33
ひとこと要約

CompLexはBible、Europarl、biomedical textsに対する5点リッカート尺度を用いた連続的語彙複雑さ予測の初の英語コーパスを提供し、ベースライン予測は有望なMAE結果を示す。

ABSTRACT

Predicting which words are considered hard to understand for a given target population is a vital step in many NLP applications such as text simplification. This task is commonly referred to as Complex Word Identification (CWI). With a few exceptions, previous studies have approached the task as a binary classification task in which systems predict a complexity value (complex vs. non-complex) for a set of target words in a text. This choice is motivated by the fact that all CWI datasets compiled so far have been annotated using a binary annotation scheme. Our paper addresses this limitation by presenting the first English dataset for continuous lexical complexity prediction. We use a 5-point Likert scale scheme to annotate complex words in texts from three sources/domains: the Bible, Europarl, and biomedical texts. This resulted in a corpus of 9,476 sentences each annotated by around 7 annotators.

研究の動機と目的

  • 語彙複雑さ予測を二値分類ではなく連続タスクとして推進する。
  • Likert尺度の複雑さスコアで注釈された多様な英語コーパスを作成する。
  • 注釈品質と語彙複雑さのジャンル間差を分析する。
  • 連続的な複雑さ予測の実現可能性を示すためのベースライン予測モデルを提供する。

提案手法

  • 語彙複雑さのための5点リッカート尺度の注釈スキームを作成する(1=Very Easy から 5=Very Difficult)。
  • Bible、Europarl、biomedicalドメインから9,476文を収集し、ターゲット(単語およびMWEs)をクラウドソーシングで注釈付けする。
  • 注釈を正規化された0–1の複雑さスコアに集約する(1->0, 2->0.25, 3->0.5, 4->0.75, 5->1)。
  • 1つの事例につき20 annotationsを使用し、品質管理を行い、参加が不十分な注釈は破棄する(有効な注釈を少なくとも4つ維持)。
  • 300-dimのGloVe語彙埋め込み、4,096-dimのInferSent文脈埋め込み、手作り特徴量(頻度、長さ、音節)を混合したベースライン回帰を訓練する。
  • 保持分割のテストセット10%を評価し、mean absolute error (MAE)を報告する。

実験結果

リサーチクエスチョン

  • RQ1語彙複雑さは二値ラベルではなく連続的な属性として効果的にモデル化できるか。
  • RQ2ドメインジャンル(Bible、Europarl、Biomed)は語彙複雑さとモデラビリティにおいてどのように異なるか。
  • RQ3LCPのための語レベル埋め込みと文脈埋め込みおよび手作り特徴量の予測価値はどれくらいか。
  • RQ4MWEsはドメインを超えて単語と比べて複雑さが異なるか。
  • RQ5標準的な語彙特徴量と埋め込みを用いた場合、線形モデルはCompLexでどの程度のベースライン性能を達成できるか。

主な発見

  • 本コーパスは9,476文からなり、平均複雑さは約0.395(標準偏差0.115)。
  • 単語の平均複雑さは0.385、MWEsは平均0.444で、ドメイン間差(Biomedは高い複雑さ)を示す。
  • 手作り特徴量を用いたベースライン線形回帰は、最良の設定でMAE 0.0853を達成。
  • 語彙埋め込みのみでMAE 0.0875、手作り特徴量と同等。文脈埋め込みは予測力が低く(MAEは改善されず)。
  • Europarlは一般に低いMAE (0.0801)を示し、Bible (0.6648) および Biomed (0.2954) より予測性がドメイン固有であることを示唆する。
  • このベースライン設定では文脈埋め込みが一貫して予測を改善せず、代替モデルでの改善の可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。