Skip to main content
QUICK REVIEW

[論文レビュー] Representations of Language Varieties Are Reliable Given Corpus Similarity Measures

Jonathan Dunn|arXiv (Cornell University)|Apr 3, 2021
Linguistic Variation and Morphology参考文献 22被引用数 6
ひとこと要約

本研究では、9つの言語における84の言語様式について、ウェブおよびTwitterデータというデジタル地理的参照付きコーパスが言語様式をどれだけ信頼性高く表現できるかを評価する。頻度に基づく類似度測定を用い、ウェブコーパスとツイートコーパスの間で強い順位相関(全体でrho = 0.453)が得られた。これは、言語的変異の表現が一貫しており、計算言語学研究におけるデジタルコーパスの利用を支持するものである。

ABSTRACT

This paper measures similarity both within and between 84 language varieties across nine languages. These corpora are drawn from digital sources (the web and tweets), allowing us to evaluate whether such geo-referenced corpora are reliable for modelling linguistic variation. The basic idea is that, if each source adequately represents a single underlying language variety, then the similarity between these sources should be stable across all languages and countries. The paper shows that there is a consistent agreement between these sources using frequency-based corpus similarity measures. This provides further evidence that digital geo-referenced corpora consistently represent local language varieties.

研究の動機と目的

  • デジタル地理的参照付きコーパス(ウェブおよびTwitter)が、地域的言語様式を信頼性高く表現できるかどうかを評価すること。
  • 複数の言語および国で、異なるデータソース(ウェブ対ツイート)間の言語的類似度パターンの整合性を評価すること。
  • 頻度に基づくコーパス類似度測定が、言語的変異をモデル化するためのデジタルコーパスの信頼性を検証できるかどうかを検討すること。
  • レジスタの違い(書面対ソーシャルメディア)が、実際の言語様式パターンを歪めたり、歪めることなく反映するかどうかを調査すること。
  • 信頼性と他の検証手法との整合性を実証的根拠として確立することで、計算言語学研究におけるデジタルコーパスの広範な利用を支援すること。

提案手法

  • 国と言語ごとに地理的参照がなされた、ウェブ(Common Crawl)およびTwitterデータから84の言語様式コーパスを構築した。
  • 各言語および各様式・レジスタの組み合わせ(例:メキシコスペイン語のツイート)について、平均特徴頻度を計算した。
  • 言語レベルの平均と様式固有の平均との間で、頻度に基づく類似度指標を用いてコーパス類似度を測定した。
  • ウェブおよびTwitterレジスタ間の言語様式順位の比較にスピアマン順位相関を用いた。
  • 国ごとにレジスタ間類似度値を集約し、レジスタの一致に関する地理的傾向を分析した。
  • 統計的検定と可視化(例:図7)を用いて、相関の有意性および地理的パターンの評価を行った。

実験結果

リサーチクエスチョン

  • RQ1ウェブおよびTwitterコーパスは、複数の言語において言語様式の類似度順位を一貫して生成するか?
  • RQ2ある言語様式について、ウェブとツイートという異なるデジタルレジスタ間で、言語様式の類似度が安定しているか?
  • RQ3レジスタ間類似度の地理的パターンは、予想される地域的傾向とどの程度一致するか?
  • RQ4類似度測定値はどの程度言語間で相関し、どの言語でデータソース間の一致が最も強いか?
  • RQ5異なるレジスタ間でデジタルコーパスの信頼性が保証されるなら、言語的変異のモデル化における有効性は支持されるか?

主な発見

  • ウェブコーパスとTwitterコーパスにおける言語様式の類似度順位の全体的なスピアマン順位相関は0.453であり、すべての言語で顕著な一貫性があることを示している。
  • ドイツ語、フランス語、ポルトガル語、ロシア語では統計的に有意な相関(rho > 0.78)を示しており、これらの言語における表現の信頼性が強いことを示している。
  • 66か国の平均レジスタ間類似度は0.855であり、62か国の類似度が0.80~0.89の範囲内にあった。これは、表現の高い安定性を示している。
  • バーレインとブラジルの2か国だけが低い一致(0.80未満)を示しており、ブラジルはポルトガル語の文字ベース測定の精度が低いために影響を受けていた可能性がある。
  • ナイジェリアとニュージーランドでは高い一致(0.90以上)を示しており、デジタルコーパス表現の整合性が強いことを示している。
  • 西ヨーロッパ諸国が一括りに集まらないといった期待される地理的クラスタリングの欠如も、信頼性をさらに裏付けている。言語的変異は予測可能な地域的パターンに従わないからである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。