Skip to main content
QUICK REVIEW

[論文レビュー] Assessing Digital Language Support on a Global Scale

Gary Simons, Abbey L. Thomas|arXiv (Cornell University)|Sep 27, 2022
Linguistics, Language Diversity, and Identity被引用数 7
ひとこと要約

本稿では、143のデジタルツールから抽出した言語対応データを用いたMokken尺度分析を用いて、ISO 639言語すべてのデジタル言語対応(DLS)を説明可能で自動化された方法で定量化する手法を提案する。この手法により、Still(未発展)、Emerging(発展途上)、Ascending(上昇中)、Vital(健在)、Thriving(繁栄中)の五段階のスケールが得られ、その結果、33言語(0.4%)がThrivingに分類された一方で、3,996言語(51.1%)がStillに分類され、世界的なデジタル言語格差が浮き彫りになった。

ABSTRACT

The users of endangered languages struggle to thrive in a digitally-mediated world. We have developed an automated method for assessing how well every language recognized by ISO 639 is faring in terms of digital language support. The assessment is based on scraping the names of supported languages from the websites of 143 digital tools selected to represent a full range of ways that digital technology can support languages. The method uses Mokken scale analysis to produce an explainable model for quantifying digital language support and monitoring it on a global scale.

研究の動機と目的

  • すべてのISO 639言語において、デジタル言語対応(DLS)を自動的かつ説明可能な方法で測定するための手法を開発すること。
  • ブラックボックスモデルの限界を克服するため、決定論的で解釈可能なDLSの評価を構築すること。
  • DLSを1つの潜在的特徴として定量化することで、言語のデジタル活力の時間的変化をモニタリングすること。
  • Kornai(2013)の手法とは異なり、デジタル活力の混合指標ではなく、DLSに特化することで、Kornaiの手法のスケーラブルな代替案を提供すること。
  • EthnologueがDLSレポートをその世界的言語データベースに統合するのを支援すること。

提案手法

  • 143のデジタルツール(多様なデジタル技術分野をカバー)のWebサイトから言語対応データを収集するためのウェブスクレイピングを実施する。
  • 7つのDLSカテゴリー(Surface, Encoding, Content, Localized, Speech, Assistant, Meaning)の単一次元的尺度の妥当性を検証するため、Mokken尺度分析を適用する。
  • 項目反応理論(IRT)を用いて、言語が各DLSカテゴリーに到達する確率をモデル化する項目反応関数(IRF)を導出する。
  • DLSスコアは最大スコア(0〜28)に対する割合として正規化され、IRFからの確率を用いて、誤ったまたは持続不可能な対応を補正する。
  • 得られたDLSスコアは、対数スケールで反転したランク軸にプロットされ、イノベーション採用に特徴的なS字型成長パターンが明らかになる。
  • 各言語が適合されたS字型曲線に沿った幾何的位置に基づき、Still(未発展)、Emerging(発展途上)、Ascending(上昇中)、Vital(健在)、Thriving(繁栄中)の5つの要約段階が割り当てられる。

実験結果

リサーチクエスチョン

  • RQ1すべてのISO 639言語において、スケーラブルで説明可能かつ決定論的な方法でデジタル言語対応(DLS)を測定するにはどうすればよいか?
  • RQ2DLSは非デジタル言語の活力とどの程度相関しているのか。また、それらを意味的に分離できるか?
  • RQ3Mokken尺度分析は、デジタルツールの多様で現実的なデータを用いて、DLSの単一次元的特徴を効果的にモデル化できるか?
  • RQ4世界の言語におけるDLSの世界的な分布はどのようになっており、それは成長曲線のパターンに従っているか?
  • RQ5どの言語がデジタル活力への道のりを歩んでおり、どの言語が話者数が多くても依然として支援が得られていないのか?

主な発見

  • DLSスケールは全スケールで同質係数(H)が0.825を示し、内部的一致性が高く信頼性の高い測定であることが確認された。
  • DLS項目の中で最も高いH値(Assistant: H = 0.987、Speech: H = 0.942)を示した項目は、スケーラビリティが強く、累積的で堅牢な対応を示している。
  • 33言語(0.4%)がThrivingに分類されたが、これは英語やハンガリー語を含み、完全なデジタル対応の狭いピークを示している。
  • 3,996言語(51.1%)がStillに分類されたが、これはアイマク語やユーロク語を含み、顕著な話者数を持つにもかかわらず、最小限または完全なデジタル対応が見られないことを示している。
  • 7,829言語のDLSスコアは、対数スケールで反転したランク軸にプロットされた際に明確なS字型成長パターンを示し、イノベーション採用のトレンドと整合することが確認された。
  • モデルは、キーボード入力やエンコードといった基盤的支援と、仮想アシスタントのような高度な機能との違いを的確に区別できており、項目難易度が示すように、高度な機能は前段階の支援が十分に整った上で実現可能であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。