Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Discourse Information Effectively for Authorship Attribution

Su Wang, Elisa Ferracane|arXiv (Cornell University)|Sep 7, 2017
Authorship Attribution and Profiling参考文献 20被引用数 6
ひとこと要約

本稿では、文法的関係または修辞的構造理論(RST)関係から得られるグローバルな話法特徴を、文字レベルの畳み込みニューラルネットワーク(CNN)に統合する、新しい話法埋め込み手法を提案する。全コアファレンスチェーンをモデル化し、話法遷移の密な埋め込みを学習することで、従来の確率的ベクトル手法や局所的特徴化手法を上回る最先端の性能を達成する。

ABSTRACT

We explore techniques to maximize the effectiveness of discourse information in the task of authorship attribution. We present a novel method to embed discourse features in a Convolutional Neural Network text classifier, which achieves a state-of-the-art result by a substantial margin. We empirically investigate several featurization methods to understand the conditions under which discourse features contribute non-trivial performance gains, and analyze discourse embeddings.

研究の動機と目的

  • 話法情報がどのように効果的に特徴化され、最先端の深層学習モデルに統合されるかを調査すること。
  • 全エンティティの軌跡を捉えるグローバルな話法モデリングが、局所的でペアワイズの文単位モデリングよりも優れた性能をもたらすかどうかを特定すること。
  • 話法埋め込みと従来の話法特徴の確率的ベクトル表現の有効性を評価すること。
  • コアファレンスチェーンや話法構造(例:RSTツリー)が分類性能を向上させる役割を理解すること。
  • 話法特徴が非自明な向上をもたらす条件、特にテキスト長さとジャンルとの関係を特定すること。

提案手法

  • 重要なエンティティを含むすべての文のペアに対して、文法的関係(例:主語、目的語)またはRST話法関係(例:説明、結果)を追跡するエンティティグリッドを構築することで、話法を特徴化する。
  • 各エンティティの関係の完全なシーケンスを処理することでグローバル特徴化を実施し、コアファレンスチェーンの構造を保持する。これは、隣接する文ペアのみを考慮する局所的特徴化とは対照的である。
  • 入力層で話法埋め込みを並列するCNNブランチにフィードすることで、話法特徴を文字レベルのCNN分類器に統合する。出力で連結するのではなく、入力で統合する。
  • 語のサイズの畳み込みフィルタを用いて、話法遷移の階層的表現を学習し、重みの学習により関係間の依存関係を捉える。
  • t-SNE可視化を用いて、学習された話法埋め込みの構造を分析し、意味的に類似した関係がクラスタリングするかどうかを評価する。
  • 話法確率的ベクトル(従来手法)と学習された話法埋め込み(提案手法)を用いたモデルの性能を比較し、文法的関係およびRST関係を入力として用いる。

実験結果

リサーチクエスチョン

  • RQ1全エンティティの軌跡をモデル化するグローバルな話法特徴化は、隣接する文ペアのみを考慮する局所的特徴化よりも優れた性能をもたらすか?
  • RQ2CNNを用いて学習された話法埋め込みは、従来の話法確率的ベクトルを上回る性能を示せるか?
  • RQ3話法情報の組み込みが、短いテキストでの性能にどのように影響するか。話法が寄与するための最小テキスト長の閾値は存在するか?
  • RQ4コアファレンスチェーンや話法構造(例:RSTツリーの順序)は、話法特徴の有効性にどの程度影響を与えるか?
  • RQ5なぜRSTベースの特徴が文法的関係(GR)特徴を上回るのか。RSTのグローバル構造的視点がこの向上に果たす役割は何か?

主な発見

  • 特にCNN2-DE(グローバル)モデルとして提案された話法埋め込み手法は、確率的ベクトルのみを用いたモデルを大きく上回り、著者識別タスクで最先端の性能を達成した。
  • グローバル特徴化は一貫して局所的特徴化を上回り、コアファレンスチェーン構造のより良い保持により、実験全体で平均F1スコアが1ポイント向上した。
  • CNNを用いて学習された話法埋め込みは、エンドツーエンドの重み学習を活用し、より細分化された話法表現を提供するため、従来の確率的ベクトル表現を上回った。
  • RSTベースの話法特徴は、文法的関係(GR)特徴よりも高い性能向上を示した。特に大規模で複雑なデータセットでは顕著で、RSTのグローバル構造的視点がその理由と考えられる。
  • 話法特徴は長文でのみ非自明な性能向上をもたらす。短いテキスト(例:小説の断片、映画レビュー)では、コアファレンスチェーンが十分に存在しないため、話法の有用性が制限される。
  • t-SNE可視化の結果、類似した話法関係(例:説明と解釈)が埋め込み空間でクラスタリングしていることが示され、埋め込みに意味的な構造が正しくエンコードされていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。