Skip to main content
QUICK REVIEW

[論文レビュー] NILC-Metrix: assessing the complexity of written and spoken language in Brazilian Portuguese

Sidney Evaldo Leal, Magali Sanches Duran|arXiv (Cornell University)|Dec 17, 2021
Text Readability and Simplification被引用数 7
ひとこと要約

本稿では、話法・心理言語学・計算言語学に由来する200の言語的指標を備えた、公開可能な計算システムNILC-Metrixを紹介する。このシステムは、ブラジルポルトガル語におけるテクストの複雑さを評価することを目的としており、児童の字幕と学校用教科書の比較、PorSimplesコーパスにおける複雑さの予測、学校の学年予測のモデリングの3つの応用を通じて、その有効性を示している。本フレームワークは、複数の言語的レベルおよびタスクにおいて、強固な性能を発揮している。

ABSTRACT

This paper presents and makes publicly available the NILC-Metrix, a computational system comprising 200 metrics proposed in studies on discourse, psycholinguistics, cognitive and computational linguistics, to assess textual complexity in Brazilian Portuguese (BP). These metrics are relevant for descriptive analysis and the creation of computational models and can be used to extract information from various linguistic levels of written and spoken language. The metrics in NILC-Metrix were developed during the last 13 years, starting in 2008 with Coh-Metrix-Port, a tool developed within the scope of the PorSimples project. Coh-Metrix-Port adapted some metrics to BP from the Coh-Metrix tool that computes metrics related to cohesion and coherence of texts in English. After the end of PorSimples in 2010, new metrics were added to the initial 48 metrics of Coh-Metrix-Port. Given the large number of metrics, we present them following an organisation similar to the metrics of Coh-Metrix v3.0 to facilitate comparisons made with metrics in Portuguese and English. In this paper, we illustrate the potential of NILC-Metrix by presenting three applications: (i) a descriptive analysis of the differences between children's film subtitles and texts written for Elementary School I and II (Final Years); (ii) a new predictor of textual complexity for the corpus of original and simplified texts of the PorSimples project; (iii) a complexity prediction model for school grades, using transcripts of children's story narratives told by teenagers. For each application, we evaluate which groups of metrics are more discriminative, showing their contribution for each task.

研究の動機と目的

  • ブラジルポルトガル語におけるテクスト複雑さを評価する包括的かつ公開可能な言語的指標システムの開発。
  • Coh-Metrixなどの英語ベースのツールから得られた指標を、ブラジルポルトガル語の文脈に拡張・適応させ、言語間での比較可能性を確保すること。
  • さまざまな言語的レベルにおける書記語と話상語の記述的分析および計算モデリングを支援すること。
  • テキスト簡略化や教育的テキスト複雑さ予測を含む、実世界のNLP応用における指標群の有効性を検証すること。
  • 今後の研究を促進するため、コード、データセット、および指標の実装・拡張に適したモジュラー・フレームワークをリリースすること。

提案手法

  • PorSimplesプロジェクトおよびその後の研究で開発された200の指標を再実装し、統合・再構成した。対象となる特徴は、結束・一貫性・語彙的・構文的・意味的要因を含む。
  • Coh-Metrix v3.0の構造に従って指標を整理し、既存の英語ベースのツールと一貫性と比較可能性を確保した。
  • LX-Parser、MaltParser、Palavrasを用いた構文解析、およびLSAベースの手法による意味的結束指標を用いた。
  • 3つの異なるタスクにおいて、指標特徴を用いてテキスト複雑さを予測するための従来の機械学習分類器を適用した。
  • アイデア密度や語彙的結束度といった新規指標を実装し、POeTiSAプロジェクトの堅牢な構文解析モデルを統合する計画である。
  • 児童の物語や簡略化済みテキストを含む、異なるテキストタイプおよび複雑さレベルにおける指標群の判別力の評価を行った。

実験結果

リサーチクエスチョン

  • RQ1ブラジルポルトガル語において、児童向け映画字幕と学校レベルの書記テキストの間の複雑さの違いを最も効果的に区別する言語的指標群はどれか?
  • RQ2NILC-Metrix指標は、PorSimplesコーパスのオリジナル版および簡略化版のテキスト複雑さをどの程度正確に予測できるか?
  • RQ3ティーンエイジャーの話상ナラティブから、NILC-Metrix指標に基づくモデルが学校の学年レベルを的確に予測できるか?
  • RQ4語彙的・構文的・結束的・意味的といった異なる言語的レベルは、多様なテキストタイプにおける複雑さの判別にどの程度寄与するか?
  • RQ5堅牢な構文解析モデルの統合は、ブラジルポルトガル語におけるアイデア密度や時間的結束といった指標の信頼性と一般化能力をどのように向上させるか?

主な発見

  • NILC-Metrixシステムは、児童向け映画字幕と学校用教科書の間の複雑さの違いを的確に捉えており、語彙的および結束的指標が特に強い判別力を示した。
  • PorSimplesコーパスのテキスト複雑さを予測する新しい予測器は、構文的および語彙的指標の組み合わせにより高い精度を達成し、テキスト簡略化の評価における本システムの有効性を示した。
  • ティーンエイジャーのナラティブトランスクライブを用いた学校学年予測モデルは、顕著な性能を示した。特に意味的および結束的指標が情報量が多く寄与した。
  • 語彙的多様性、文長、および結束(特に接続詞と内容語の関連)に関する指標は、3つの応用すべてにおいて一貫して最も判別力の高いものであった。
  • 今後バージョンにおいて、POeTiSAプロジェクトの堅牢な構文解析モデルを統合することで、アイデア密度や時間的結束といった指標の信頼性が向上すると予想される。
  • AGPLv3ライセンスでコードとデータセットをオープンリリースしたことで、再現性が確保され、ブラジルポルトガル語における計算言語学およびNLP分野の今後の研究を促進できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。