Skip to main content
QUICK REVIEW

[論文レビュー] A Low Dimensionality Representation for Language Variety Identification

Francisco Rangel, Marc Franco-Salvador|arXiv (Cornell University)|May 30, 2017
Authorship Attribution and ProfilingComputer Science参考文献 8被引用数 17
ひとこと要約

本稿では、スペイン語の言語様式識別に向けた低次元表現(LDR)を提案する。統計的特徴量(平均、標準偏差、確率に基づく語句重みなど)を用いて、1言語様式あたり6特徴量に次元削減を実現する。この手法は、最先端のベースラインより35%の精度向上を達成し、スケールの大きなデータ環境下でも、Skip-gram や SenVec といった分散表現モデルと同等の性能を示し、多様な言語様式に対して高い耐障害性を示す。

ABSTRACT

Language variety identification aims at labelling texts in a native language (e.g. Spanish, Portuguese, English) with its specific variation (e.g. Argentina, Chile, Mexico, Peru, Spain; Brazil, Portugal; UK, US). In this work we propose a low dimensionality representation (LDR) to address this task with five different varieties of Spanish: Argentina, Chile, Mexico, Peru and Spain. We compare our LDR method with common state-of-the-art representations and show an increase in accuracy of ~35%. Furthermore, we compare LDR with two reference distributed representation models. Experimental results show competitive performance while dramatically reducing the dimensionality --and increasing the big data suitability-- to only 6 features per variety. Additionally, we analyse the behaviour of the employed machine learning algorithms and the most discriminating features. Finally, we employ an alternative dataset to test the robustness of our low dimensionality representation with another set of similar languages.

研究の動機と目的

  • ソーシャルメディアのテキストにおいて、メキシコ語、スペイン語、アルゼンチン語など言語様式(例:メキシコ語、スペイン語、アルゼンチン語)を高精度に同定する課題に対処すること。
  • 特にソーシャルメディア応用を想定したスケーラビリティを高めるために、テキスト表現の次元削減を実現すること。
  • n-gram やディープラーニングに基づく表現に依存せずに、語彙的および統計的差異を捉える特徴量セットを構築すること。
  • 訓練データとテストデータの間にデータ漏洩を避けるために、著者単位で明確に分離することで、一般化性能を保証すること。
  • 再現可能性および言語様式識別の分野におけるさらなる研究を支援するため、データセットを公開すること。

提案手法

  • LDR手法は、各言語様式ごとの語句頻度の統計的特徴量(平均、標準偏差、最小値、最大値、確率、割合)を計算する。
  • 各ドキュメントは、その言語様式のトレーニングデータにおける語句頻度分布に基づき、1言語様式あたり6次元のベクトルで表現される。
  • 特徴量にtf-idf重み付けを適用することで、共通語彙に起因するノイズを低減し、各言語様式に特徴的な語句を強調する。
  • 情報ゲインに基づいて特徴量を選択し、分類に最も寄与する特徴量を優先的に採用する。
  • 機械学習分類器(例:SVM または類似手法)を、低次元特徴量ベクトル上で学習させ、正しい言語様式を予測する。
  • 著者が訓練セットとテストセットの両方に含まれないよう保証することで、過学習を回避し、評価の整合性を維持する。

実験結果

リサーチクエスチョン

  • RQ1低次元特徴表現が、従来のn-gramおよび最先端の表現手法を上回る性能を示せるか?
  • RQ21言語様式あたり6特徴量にまで次元削減した場合、分類精度とスケーラビリティにどのような影響が生じるか?
  • RQ3平均、標準偏差、最小/最大値、確率といった異なる統計的特徴量が、密接に似た言語様式を区別するために果たす貢献度はどの程度か?
  • RQ4LDR手法は、スペイン語に限らず、他の言語対や言語様式に対しても一般化性能を示せるか、特に類似言語の識別タスクにおいて有効か?
  • RQ5さまざまな言語様式において、LDRはSkip-gram や SenVec といった分散表現と比較して、どの程度の性能を示すか?

主な発見

  • LDR手法はスペイン語の言語様式識別タスクで71.1%の精度を達成し、ベースライン手法より約35%の向上を示した。
  • 特徴量次元は数千から1言語様式あたりわずか6にまで削減され、スケーラビリティの向上が顕著に現れた。
  • 標準偏差に基づく特徴量のみで69.2%の精度を達成し、平均特徴量と組み合わせることで70.8%に向上した。これは最小/最大値に基づく特徴量を上回った。
  • DSLCCコーパスにおける多様な言語対に対して、LDRは高い耐障害性を示し、精度はボスニア語で78.0%、インドネシア語・チェコ語で99.9%の範囲を示した。これはSkip-gram や SenVec と同等の性能であった。
  • DSLCCセットのポルトガル語およびスペイン語の言語様式において、LDRはスペインで84.7%、アルゼンチンで88.0%、ポルトガルで87.4%、ブラジルで90.0%の精度を達成し、優れた言語間一般化性能を示した。
  • LDR手法は、PAN 2018コンペティションにおける著者プロファイリングの年齢・性別識別タスクにも成功裏に適用され、上位チームと同等の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。