Skip to main content
QUICK REVIEW

[論文レビュー] A Speech Act Classifier for Persian Texts and its Application in Identifying Rumors

Zoleikha Jahanbakhsh-Nagadeh, Mohammad‐Reza Feizi‐Derakhshi|arXiv (Cornell University)|Jan 12, 2019
Topic Modeling参考文献 24被引用数 7
ひとこと要約

本稿では、語彙的、構文的、意味的、表面的特徴に加え、WordNetを用いた類義語抽出と特徴拡張を組み合わせた辞書ベースの統計的手法を提案し、ペルシャ語の言語行為を7つのカテゴリに分類する。複数の分類器を用いた評価において、ランダムフォレストとSVMを用いることで95%の精度を達成し、このフレームワークをペルシャ語のフェイクニュースに広く見られる言語行為の特定に応用した。主に物語的、質問的、脅し、依頼のタイプが顕著であった。

ABSTRACT

Speech Acts (SAs) are one of the important areas of pragmatics, which give us a better understanding of the state of mind of the people and convey an intended language function. Knowledge of the SA of a text can be helpful in analyzing that text in natural language processing applications. This study presents a dictionary-based statistical technique for Persian SA recognition. The proposed technique classifies a text into seven classes of SA based on four criteria: lexical, syntactic, semantic, and surface features. WordNet as the tool for extracting synonym and enriching features dictionary is utilized. To evaluate the proposed technique, we utilized four classification methods including Random Forest (RF), Support Vector Machine (SVM), Naive Bayes (NB), and K-Nearest Neighbors (KNN). The experimental results demonstrate that the proposed method using RF and SVM as the best classifiers achieved a state-of-the-art performance with an accuracy of 0.95 for classification of Persian SAs. Our original vision of this work is introducing an application of SA recognition on social media content, especially the common SA in rumors. Therefore, the proposed system utilized to determine the common SAs in rumors. The results showed that Persian rumors are often expressed in three SA classes including narrative, question, and threat, and in some cases with the request SA.

研究の動機と目的

  • ペルシャ語の実用的言語処理ツールの不足を補うべく、ペルシャ語テキスト向けの信頼性の高い言語行為分類システムの開発。
  • ソーシャルメディアにおけるフェイクニュースの構造と拡散に、言語行為が果たす役割の解明。
  • 特徴豊富な辞書ベースのアプローチを用いて、ペルシャ語の言語行為認識において複数の機械学習分類器の性能を評価すること。
  • ペルシャ語のフェイクニュースに最も頻出する言語行為タイプを特定し、自動フェイクニュース検出および分析を支援すること。

提案手法

  • 本手法は、アサーション、ディレクティブ、コミッショネィブ、エクスプレッシブ、ディクレラティブ、質問、リクエストの7つの言語行為カテゴリに分類する辞書ベースの統計的手法を採用する。
  • 語彙的(語の頻度と分布)、構文的(文構造のパターン)、意味的(WordNetによる類義語と語の意味)、表面的特徴(句読点、大文字、長さ)の4種類の特徴を統合する。
  • WordNetを用いて、キーワードの類義語を特定し、意味的カバレッジを拡張することで特徴辞書を拡充する。
  • ランダムフォレスト(RF)、サポートベクターマシン(SVM)、ナイーブベイズ(NB)、K-近傍法(KNN)の4つの分類器を、アノテート済みデータセット上で性能評価する。
  • 手動でアノテートされたペルシャ語コーパスを用いてシステムを学習・評価し、特徴工学は言語行為の区別に最大の判別力をもたらすように最適化する。
  • 最終モデルでは、最も高い性能を示した分類器(RFとSVM)を選択し、フェイクニュース分析アプリケーションへの導入を実施する。

実験結果

リサーチクエスチョン

  • RQ1ペルシャ語のソーシャルメディアにおけるフェイクニュースに、どの言語行為タイプが最も頻出しているか?
  • RQ27つの事前に定義されたカテゴリに分類するペルシャ語の言語行為に対して、辞書ベースの統計的手法はどの程度有効か?
  • RQ3提案された特徴セットを用いた場合、RF、SVM、NB、KNNのうち、どの機械学習分類器がペルシャ語の言語行為分類において最も優れた性能を示すか?
  • RQ4言語行為分類は、ペルシャ語のオンラインコンテンツにおけるフェイクニュースの検出と理解を向上させることができるか?

主な発見

  • 提案された言語行為分類器は、ランダムフォレストとサポートベクターマシンをベース分類器として用いることで、最先端の95%の精度を達成した。
  • ランダムフォレストとSVMは、ペルシャ語テキストの特徴の複雑さに対して耐性を示し、ナイーブベイズとK-近傍法を上回る性能を示した。
  • 物語的、質問的、脅し、依頼の言語行為が、ペルシャ語のフェイクニュースにおいて最も一般的なタイプであることが判明し、誤情報の構造的役割を示唆した。
  • WordNetの統合により、特徴の豊かさが著しく向上し、意味的関係を捉えることで分類性能が向上した。
  • 大規模なアノテート済み学習データがなくても、辞書ベースのアプローチが有効であることが実証され、ペルシャ語のような低リソース言語に対しても適していることが示された。
  • 結果から、言語行為分析が、ペルシャ語のソーシャルメディア向け自動フェイクニュース検出システムにおける価値ある信号であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。