Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Global Syntactic Variation in English Using Dialect Classification

Jonathan Dunn|arXiv (Cornell University)|Apr 11, 2019
Linguistic Variation and Morphology被引用数 4
ひとこと要約

本稿では、14の国別英語バリエーションにおけるグローバルな構文的変異をモデル化するためのデータ駆動型で文法誘導に基づくアプローチを提案する。系統的分類を用いて地域固有の構文的好みを特定する。動的構文特徴空間が、ウェブおよびソーシャルメディアコーパスにおいても頑健な系統的分類を可能にし、全体の正確性はやや低いものの、語彙ベースのベースラインと比較して構文モデルはより高い言語的特異性を示すことを示している。

ABSTRACT

This paper evaluates global-scale dialect identification for 14 national varieties of English as a means for studying syntactic variation. The paper makes three main contributions: (i) introducing data-driven language mapping as a method for selecting the inventory of national varieties to include in the task; (ii) producing a large and dynamic set of syntactic features using grammar induction rather than focusing on a few hand-selected features such as function words; and( iii) comparing models across both web corpora and social media corpora in order to measure the robustness of syntactic variation across registers.

研究の動機と目的

  • 構文的変異モデル化のためのスケーラブルでデータ駆動型の方法を開発し、恣意的な地域的境界を回避する。
  • 文法誘導を通じて動的かつ再現可能な構文特徴のセットを生成し、関数語のような事前に定義された特徴に依存しないようにする。
  • 異なるテキストレジスタ(ウェブ対ソーシャルメディア)における構文モデルの頑健性を評価し、少数の予測特徴に過度に依存しないかを検証する。
  • 特に構文的構造が不足している代表が少ない外圏方言をモデル化する課題に対処する。

提案手法

  • ウェブおよびTwitterデータにデータ駆動型言語マッピングを適用し、一貫して使用される英語の国別バリエーションを同定し、地理的および言語的に代表的な地域を含める。
  • 大規模なバックグラウンドコーパスを用いた文法誘導により、事前に定義された言語的特徴に依存せずに、動的かつ包括的な構文特徴のセットを自動抽出する。
  • テキスト分類モデル(Joachims, 1998に従う)を訓練し、構文特徴に基づいて国別バリエーションの所属を予測する。この際、系統的識別を補助タスクとして最適化する。
  • ウェブクロールド(Common Crawl)とソーシャルメディア(Twitter)という2つの異なるコーパスを比較し、レジスタ固有の頑健性を評価する。
  • 著者識別におけるメタ分類技術であるアンマスキングを用い、予測性の高い特徴を繰り返し削除し、100ラウンドにわたってモデルの安定性を評価する。
  • F1スコアを主な指標として用い、アンマスキング中の性能低下を追跡することで、構文モデルと語彙モデルの比較が可能になる。

実験結果

リサーチクエスチョン

  • RQ1グローバルスケールの構文的変異モデルにおいて、恣意的な地域的境界を避けて英語の国別バリエーションを体系的に選択する方法は何か?
  • RQ2文法誘導は、多様な国別バリエーションにわたる変異を捉える動的かつ包括的な構文特徴空間をどの程度生成できるか?
  • RQ3ウェブコーパスとソーシャルメディアという異なるテキストレジスタにおいて、構文モデルの方言変異モデルはどの程度頑健か?
  • RQ4これらのモデルは少数の非常に予測性の高い構文特徴にどの程度依存しているのか?また、特徴の削除に対して性能はどの程度安定しているか?
  • RQ5外圈权方言(例えばインド英語やフィリピン英語)は構文的特徴密度が低いにもかかわらず、なぜ分類精度が高くなるのか?

主な発見

  • データ駆動型言語マッピングのアプローチにより、14の国別英語バリエーション(内圈权、外圈权、拡張圈权を含む)がグローバル構文モデルに適していると特定された。
  • 構文モデルはCommon CrawlでF1スコア0.78、TwitterデータでF1スコア0.75を達成し、語彙ベースのベースラインより全体の正確性は低いものの、構文特徴のみで頑健な系統的分類が可能であることを示した。
  • アンマスキング実験により、構文モデルは語彙ベース(ユニグラム)のベースラインよりも特徴の削除に対してより速やかに性能が低下することが判明し、より少数の予測特徴に依存していることが示された。
  • アンマスキング中、ウェブクロールドモデルはTwitterモデルよりも劣化が遅く、形式的でドメインに依存しないテキストの方がより頑健であることが示唆された。
  • 外圈权方言(パキスタン英語やフィリピン英語)は内圈权方言よりも高いF1スコア(例:0.85および0.83)を達成しており、非標準的な構文パターンが分類により特徴的であることが示された。
  • 高い正確性を示すにもかかわらず、外圈权方言における構文モデルの低い特徴密度は、文法誘導プロセスが主要な構文構造を十分にモデル化できていない可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。