Skip to main content
QUICK REVIEW

[論文レビュー] MultiAzterTest: a Multilingual Analyzer on Multiple Levels of Language for Readability Assessment

Kepa Bengoetxea, Itziar González-Dios|arXiv (Cornell University)|Sep 10, 2021
Text Readability and Simplification参考文献 45被引用数 7
ひとこと要約

MultiAzterTest は、英語、スペイン語、バスク語の3言語で 125–163 の言語的・スタイル的特徴を分析し、読解性を評価するオープンソースでマルチリンガルな NLP ツールである。SVM 分類器を用いて、英語では3段階分類で 90.09% の正確度を達成し、バスク語では2段階分類で 95.50% の正確度を示し、Coh-Metrix や ErreXail といった既存ツールを上回る性能を発揮している。また、共有特徴を介した強力なクロスリンガル移転性を示している。

ABSTRACT

Readability assessment is the task of determining how difficult or easy a text is or which level/grade it has. Traditionally, language dependent readability formula have been used, but these formulae take few text characteristics into account. However, Natural Language Processing (NLP) tools that assess the complexity of texts are able to measure more different features and can be adapted to different languages. In this paper, we present the MultiAzterTest tool: (i) an open source NLP tool which analyzes texts on over 125 measures of cohesion,language, and readability for English, Spanish and Basque, but whose architecture is designed to easily adapt other languages; (ii) readability assessment classifiers that improve the performance of Coh-Metrix in English, Coh-Metrix-Esp in Spanish and ErreXail in Basque; iii) a web tool. MultiAzterTest obtains 90.09 % in accuracy when classifying into three reading levels (elementary, intermediate, and advanced) in English and 95.50 % in Basque and 90 % in Spanish when classifying into two reading levels (simple and complex) using a SMO classifier. Using cross-lingual features, MultiAzterTest also obtains competitive results above all in a complex vs simple distinction.

研究の動機と目的

  • 従来の言語特化型読解性式の限界を克服し、より包括的なテキスト複雑性分析を実現するため、高度な NLP 技術を活用する。
  • タイプロジカルに多様な言語(英語、スペイン語、バスク語など)をカバーする、マルチリンガルでオープンソースのツールを開発し、言語的および話法的特徴を分析可能にする。
  • ユニバーサル言語リソースに基づく統一フレームワークを用いて、英語、スペイン語、バスク語の単言語環境における最新の読解性分類器を改善する。
  • 特にリソースが乏しい状況を想定し、言語間で共有される特徴を用いたクロスリンガル読解性評価の実現可能性と性能を検討する。
  • 再現可能性およびテキストスタイルメトリクスと読解性分野のさらなる研究を支援するため、公開可能なウェブサービスとオープンソースのコードベースを提供する。

提案手法

  • 複数言語で動作する 11 種類の言語的特徴(記述的特徴、構文的複雑性、語彙頻度、語彙知識、語の情報量、語彙多様性、話法接続語、参照的結束性、意味的情報、意味的重複、読解性)を抽出するモジュラー NLP パイプラインを設計する。
  • 構文解析には Universal Dependencies、意味的分析には wordnets、語彙頻度には wordfreq、意味的類似性および重複にはワード埋め込みを含むユニバーサル言語リソースを活用する。
  • 抽出された特徴を用いて、テキストの読解性レベルを予測する SMO(逐次最小最適化)分類器を実装する。
  • 英語、スペイン語、バスク語のアノテート済みコーパスを用いて分類器を学習および評価し、単言語およびクロスリンガル設定の別々のモデルを構築する。
  • 特徴選択と交差検証を適用し、最も予測力の高い特徴を同定し、言語間での移植性を評価する。
  • 教育的および研究的用途を想定し、ツールの分析および分類機能への一般公開を可能にするウェブアプリケーションをデプロイする。

実験結果

リサーチクエスチョン

  • RQ1ユニバーサル NLP リソースを用いることで、言語に依存しない形で言語的特徴を容易に適応可能にすることができるか?
  • RQ2前処理ツールおよび言語リソースの品質が、読解性分類性能に与える影響は何か?
  • RQ3読解性予測において最も予測力のある特徴は何か? また、これらの特徴は言語間で共有されているか?
  • RQ4特徴群は、特に語形豊富言語と語形貧困言語の両方で一貫した正確度を示すか?
  • RQ5共通のクロスリンガル特徴セットを用いて、競争力のある読解性分類が達成可能か? また、このアプローチの有効性はいかがなものか?

主な発見

  • MultiAzterTest は、SVM 分類器を用いて、英語テキストの3段階読解性分類(初級、中級、上級)で 90.09% の正確度を達成した。
  • バスク語では、2段階分類(簡単 vs. 複雑)で 95.50% の正確度を記録し、最新の ErreXail ツールを上回った。
  • スペイン語では、2段階読解性分類で 90% の正確度を達成し、Coh-Metrix-Esp を上回った性能を示した。
  • 記述的特徴および構文的特徴群が、3言語すべてで最も予測力が高く、語の情報量は特にバスク語において顕著な影響を示した。
  • 意味的特徴および意味的重複は、予測正確度が最も低く、現在のコーパスでは読解性予測に限界があることが示された。
  • クロスリンガル特徴セットは、特に2値分類において競争力のある結果を示し、単言語データが乏しい状況下での低リソース言語応用の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。