Skip to main content
QUICK REVIEW

[論文レビュー] Including Dialects and Language Varieties in Author Profiling

Alina Maria Ciobanu, Marcos Zampieri|arXiv (Cornell University)|Jul 3, 2017
Authorship Attribution and Profiling参考文献 17被引用数 5
ひとこと要約

本稿では、文字および語のn-gramを用いたSVMアンサンブルモデルを提示し、ソーシャルメディア文書における性別および言語様式の識別を実施した。PAN 2017データセットにおいて、性別分類では平均75%の正確度、ポルトガル語の方言識別では97.9%の正確度を達成し、著者プロファイリングに方言を含める最初の共同タスクの一つとして位置づけられる。

ABSTRACT

This paper presents a computational approach to author profiling taking gender and language variety into account. We apply an ensemble system with the output of multiple linear SVM classifiers trained on character and word $n$-grams. We evaluate the system using the dataset provided by the organizers of the 2017 PAN lab on author profiling. Our approach achieved 75% average accuracy on gender identification on tweets written in four languages and 97% accuracy on language variety identification for Portuguese.

研究の動機と目的

  • マルチリンガルなソーシャルメディア文書において、言語様式や方言を含めた著者プロファイリングの拡張を図ること。
  • 短く非公式なユーザ生成コンテンツにおいて、類似した言語、言語様式、方言を区別する課題に取り組むこと。
  • 過去の共同タスク(例:DSL、ADI)で成功した手法(例:SVM)をPAN 2017の著者プロファイリングベンチマークに適応すること。
  • 一つの統合フレームワーク内で性別および言語様式識別両方の性能を評価すること。
  • 短く非標準的なテキストというデータ特性が、リソースが限られた環境におけるモデル性能に与える影響を調査すること。

提案手法

  • 性別および言語様式分類の両方において、4以上のn-gram(文字および語)を特徴量として用いた線形SVM分類器のアンサンブルを採用した。
  • 二段階アプローチを採用:まず各言語ごとに言語様式分類器を訓練し、その後それらを用いて方言や様式を予測した。
  • 特徴工学的手法として、過去の共同タスクで用いられたように、上位1,000個の頻出n-gram特徴量と品詞タグを組み合わせた。
  • ドイツ語の方言識別で高い性能を示したシステムにインspiredしたメタ分類器アプローチを実装し、性能向上を図った。
  • PAN 2017のトレーニングセットを用いて交差検証でモデルを訓練し、TIRA仮想マシンを通じて提供されたホールドアウトテストセットで評価した。
  • 二つのベースライン(BOWベースライン:bag-of-words、STATベースライン:最多クラス)との比較を実施した。

実験結果

リサーチクエスチョン

  • RQ1従来のn-gramおよびSVMベースのアプローチは、短く非公式なソーシャルメディア文書における性別および言語様式の識別に有効に機能するか?
  • RQ2特にリソースが限られた環境において、性能は異なる言語や方言によってどのように変動するか?
  • RQ3データ特性(例:短さ、非標準語)が、著者プロファイリングタスクにおけるモデルの正確度に与える影響は何か?
  • RQ4アンサンブル手法およびn-gram特徴量は、単純なベースラインに比べて、類似した言語様式を区別する際に優れているか?
  • RQ5類似したタスクで強く性能を示したにもかかわらず、期待された結果と実際の結果のギャップを説明できる要因は何か?

主な発見

  • 4つの言語における性別識別では平均75.04%の正確度を達成し、22件の参加中12位となった。
  • 言語様式識別では平均85.24%の正確度を達成し、22件中11位となった。
  • 最高の性能はポルトガル語の方言識別で、97.88%の正確度を記録し、BOWベースライン(97.12%)を顕著に上回った。
  • 性別分類ではアラビア語が最も低く(71.31%)、ポルトガル語が最も高く(77.13%)なった。英語とスペイン語は中間の水準であった。
  • すべての言語およびサブタスクにおいて、BOWベースラインおよびSTATベースラインを顕著に上回る性能を示した。
  • 交差検証では高い性能を示したが、最終的なテストセットの結果は予想より低く、データのスパarsity、モデルハイパーパramータ、またはコンペティションで深層学習アプローチが使われたことが要因である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。