Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Language Change in Historical Corpora: The Case of Portuguese

Marcos Zampieri, Shervin Malmasi|arXiv (Cornell University)|Sep 30, 2016
Natural Language Processing Techniques参考文献 33被引用数 7
ひとこと要約

本稿では、語のユニグラムと品詞(POS)n-gramを用いて語彙的および活用構文的変化をモデル化することで、歴史的ポルトガル語コーパスにおける時系列的テキスト分類のための教師あり機械学習手法を提案する。サポートベクターマシン(SVM)を用いた実験で、100年または50年ごとの時間帯に分類する際、99.8%の正確性を達成した。これにより、POS特徴量が文法的・スタイル的変化、例えば19世紀から20世紀にかけての形容詞の使用増加を明らかにした。また、古語的表現は16世紀のテキストを特定する強力なマーカーであることが示された。

ABSTRACT

This paper presents a number of experiments to model changes in a historical Portuguese corpus composed of literary texts for the purpose of temporal text classification. Algorithms were trained to classify texts with respect to their publication date taking into account lexical variation represented as word n-grams, and morphosyntactic variation represented by part-of-speech (POS) distribution. We report results of 99.8% accuracy using word unigram features with a Support Vector Machines classifier to predict the publication date of documents in time intervals of both one century and half a century. A feature analysis is performed to investigate the most informative features for this task and how they are linked to language change.

研究の動機と目的

  • 歴史的コーパスにおける時系列的コーパスにおいて、語彙的および活用構文的特徴量が、歴史的テキストの出版年を効果的に予測できるかを調査すること。
  • 語のユニグラムとPOS分布を用いた時系列分類において、特にSVMのような教師あり学習分類器の性能を評価すること。
  • 時間帯ごとの言語変化と相関する最も情報量の多い特徴量を特定・分析すること。
  • データ不足に起因する歴史的コーパスにおける低リソース問題に対処するため、人工的に生成された訓練およびテストインスタンスの可能性を検討すること。
  • 時間帯の粒度(100年対50年)が分類の正確性および言語的解釈可能性に与える影響を検討すること。

提案手法

  • 16世紀から20世紀初頭にかけての期間をカバーする歴史的ポルトガル語コーパス(Colonia)を構築し、品詞(POS)タグを付与した。
  • 語のユニグラムとPOS n-gramを特徴量として抽出し、語彙的および活用構文的変化を表現した。
  • 事前に定義された時間帯(100年および50年間隔)における出版年を予測するため、サポートベクターマシン(SVM)分類器を訓練した。
  • 同じ期間からのテキスト断片を組み合わせることで、データ不足に対処するためのデータ拡張を実施し、合成された訓練およびテストインスタンスを生成した。
  • 訓練済みSVMを用いて特徴量の重要度分析を実施し、最も判別力のある語およびPOSパターンを同定した。
  • 上位特徴量の言語的解釈を実施し、古語的表現やスタイル的変化といった、文書化された言語変化現象と関連づけた。

実験結果

リサーチクエスチョン

  • RQ1語のユニグラムとPOS n-gramは、100年および50年ごとの時間帯に分類するための歴史的ポルトガル語テキストに有効に機能するか?
  • RQ2語彙的特徴量(語のユニグラム)と比較して、活用構文的特徴量(POS n-gram)を含めることで、出版年を予測する性能は向上するか?
  • RQ3どの具体的な言語的特徴量が時系列分類において最も情報量が多く、それが実際に言語変化を反映しているか?
  • RQ4人工的に生成された訓練インスタンスは、低リソースな歴史的テキスト分類において、どの程度性能を向上させ得るか?
  • RQ5時間帯の粒度(100年対50年)の違いが、分類の正確性および言語的変化の検出可能性にどのように影響するか?

主な発見

  • SVM分類器は、語のユニグラム特徴量のみを用いて、100年ごとの時間帯に分類する際、99.8%の正確性を達成した。
  • 50年ごとの時間帯に対しても、同じモデルが99.8%の正確性を維持した。これは、語彙的特徴量が細分化された時系列の区間に対しても高い判別力を持つことを示している。
  • POS n-gramのみを用いた場合、100年区間では90.7%、50年区間では90.1%の正確性を達成した。文法的および構文的パターンが時間的変化の強力な指標であることが示された。
  • 最も情報量の多かった特徴量には、「per」と「pera」のような古語的語彙が含まれており、これらは16世紀のテキストに強く特徴的で、ラテン語の影響を反映している。
  • 19世紀および20世紀における形容詞の使用増加は、POS n-gramによって捉えられたスタイル的変化として特定された。これは、時間経過に伴う文章スタイルの変化を示している。
  • 特徴量分析から、POS n-gramはトピックの特異性の影響をあまり受けず、文法的およびスタイル的進化と直接的に関連していることが判明した。これにより、構造的言語変化の検出に有用であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。