Skip to main content
QUICK REVIEW

[論文レビュー] Distinguishing Fact from Fiction: Pattern Recognition in Texts Using Complex Networks

J. T. Stevanak, Lincoln D. Carr|arXiv (Cornell University)|Jul 15, 2010
Complex Network Analysis Techniques参考文献 1被引用数 5
ひとこと要約

本稿では、語の間隔が固定された範囲(m)内にある語同士を結ぶ無向・無重みの意味的ネットワークとしてテキストをモデル化し、複雑ネットワーク理論を用いて小説と非小説的ニュース記事を区別する手法を提案する。パワーロー法則に従う次数分布やクラスタリング係数分布に加え、線形判別分析を用いることで、m=4のとき小説で73.8%、ニュースで69.1%の正確性を達成し、100〜200語の長さから信頼できる分類が可能となる。

ABSTRACT

We establish concrete mathematical criteria to distinguish between different kinds of written storytelling, fictional and non-fictional. Specifically, we constructed a semantic network from both novels and news stories, with $N$ independent words as vertices or nodes, and edges or links allotted to words occurring within $m$ places of a given vertex; we call $m$ the word distance. We then used measures from complex network theory to distinguish between news and fiction, studying the minimal text length needed as well as the optimized word distance $m$. The literature samples were found to be most effectively represented by their corresponding power laws over degree distribution $P(k)$ and clustering coefficient $C(k)$; we also studied the mean geodesic distance, and found all our texts were small-world networks. We observed a natural break-point at $k=\sqrt{N}$ where the power law in the degree distribution changed, leading to separate power law fit for the bulk and the tail of $P(k)$. Our linear discriminant analysis yielded a $73.8 \pm 5.15%$ accuracy for the correct classification of novels and $69.1 \pm 1.22%$ for news stories. We found an optimal word distance of $m=4$ and a minimum text length of 100 to 200 words $N$.

研究の動機と目的

  • 複雑ネットワーク理論を用いて、小説的物語と非小説的報道記事を区別するための数学的枠組みを構築すること。
  • 意味的ネットワーク内の構造的差異が、テキストを小説または非小説として信頼性高く分類できるかどうかを調査すること。
  • 正確な分類に必要な最小テキスト長および最適な語間隔(m)を特定すること。
  • ネットワークベースの特徴量の性能を、Zipfの法則のような単純な統計的手法と比較すること。
  • 複雑ネットワークの指標が、基本的な語頻度分析よりも優れた分類正確性を示すことを実証すること。

提案手法

  • テキストサンプルから無向・無重みの意味的ネットワークを構築し、各独立語をノードとする。
  • 語がm語以内の距離に存在する場合にノード(語)間にエッジを定義し、mは1〜10の範囲で最適化する。
  • 主要な複雑ネットワーク指標を計算:次数分布P(k)、クラスタリング係数C(k)、平均地図距離。
  • 次数分布における自然な分岐点k=√Nを特定し、P(k)の本体部と尾部に対して別々にパワーロー法則のフィットを実施。
  • Fisherの線形判別分析を用いて、ネットワーク特徴量に基づき未知のテキストを分類し、誤差推定にはブートストラップ法を適用。
  • 語の頻度分布にZipfの法則を適用するベースライン手法と性能を比較。

実験結果

リサーチクエスチョン

  • RQ1複雑ネットワーク指標は、小説的物語と非小説的ニュース記事における意味的構造の違いを効果的に区別できるか?
  • RQ2小説と非小説の間で分類正確性を最大化する最適な語間隔(m)は何か?
  • RQ3意味的ネットワークの構造的差異が、分類に信頼性を持って検出可能になる最小テキスト長はどの程度か?
  • RQ4ネットワークベースの分類性能は、伝統的な統計的手法(例:Zipfの法則)と比べてどう異なるか?
  • RQ5次数分布およびクラスタリング係数分布におけるパワーロー指数は、小説と非小説の間で有意に異なるか?

主な発見

  • 分類の最適な語間隔はm=4であり、小説で73.8%、ニュース記事で69.1%の正確性を達成した。
  • 100〜200語のテキスト長から分類正確性が信頼できるようになり、約200語で性能がピークに達した。
  • 次数分布における自然な分岐点k=√Nを特定し、P(k)の本体部と尾部に対して別々のパワーロー法則フィットが可能となった。
  • クラスタリング係数C(k)もパワーロー法則的挙動を示し、小説と非小説で異なる指数を示した。
  • 平均地図距離は、すべてのテキストがスモールワールドネットワークを形成していることを確認した。これは一貫したトポロジカル特徴であった。
  • ネットワークベースの手法は、ベースラインの語頻度アプローチ(小説で48.8%、ニュースで58.4%)を著しく上回り、これはほぼまたはそれ以下の確率的水準に近い性能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。