Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Approach to Document Classification using WordNet

Koushiki Sarkar, Ritwika Law|arXiv (Cornell University)|Jan 1, 2015
Advanced Text Analysis Techniques参考文献 4被引用数 3
ひとこと要約

本稿では、語の頻度に依存せず、意味的関係性と語の意味類似度を活用することで、感情分類の性能を向上させるための新しいドキュメント分類手法を提案する。WordNetにおけるパス類似度に基づく重み付き意味ネットワークを構築することで、トゥイートやレビューなど語彙の多様性が高く、感情キーワードの頻度が低い小規模ドキュメントにおいて、従来のbag-of-wordsモデルが失敗する状況でも優れた性能を達成する。

ABSTRACT

Content based Document Classification is one of the biggest challenges in the context of free text mining. Current algorithms on document classifications mostly rely on cluster analysis based on bag-of-words approach. However that method is still being applied to many modern scientific dilemmas. It has established a strong presence in fields like economics and social science to merit serious attention from the researchers. In this paper we would like to propose and explore an alternative grounded more securely on the dictionary classification and correlatedness of words and phrases. It is expected that application of our existing knowledge about the underlying classification structure may lead to improvement of the classifier's performance.

研究の動機と目的

  • 短く多様なドキュメントにおいて、感情キーワードが存在しないか頻度が低い場合に、bag-of-wordsモデルの限界を是正すること。
  • WordNetの意味的構造を活用して、より強固で知識に基づいた分類特徴を生成すること。
  • 語の意味類似度と概念的関係(例:上位概念関係)を活用することで、感情分類の精度を向上させる分類器を開発すること。
  • 感性の良い語集合と悪い語集合のバランスを、類似度閾値(tau = 0.8 と 0.2)の経験的チューニングにより保証し、公平な分類を実現すること。

提案手法

  • WordNetのシングレット(synsets)とそのパス類似度スコアに基づき、2つの異なる重み付き語とフレーズのネットワークを構築する。
  • wn.path_similarity(synset1, synset2) を用いて、語の意味の類似度を 0〜1 のスケールで計算し、1 は同一語を示す。
  • tau 値(good 用に 0.8、bad 用に 0.2)を用いたしきい値ベースのフィルタリング処理を実施し、代表的な感性語集合を抽出する。
  • 図書の「受賞歴」セクションを有する Wikipedia のエントリ(12件)からキーワードを抽出し、それらを WordNet のシングレットにマッピングして意味的分析を実施する。
  • 部分文字列マッチングを用いて関連するリンクを特定することで、ドキュメント内容における選択された感性語の出現回数を数え、頻度行列を構築する。
  • 「but」や「however」などの文法的接続詞を活用して、感情の反転を検出し、感情平均化のための {+1, -1} の符号をセグメントに割り当てる。

実験結果

リサーチクエスチョン

  • RQ1WordNetからの意味的類似度を活用することで、特に低頻度または短いテキストの状況において、従来のbag-of-wordsモデルと比較してドキュメント分類性能が向上するか。
  • RQ2WordNetにおける語の意味と概念的関係を活用することで、より強固でバランスの取れた感性特徴集合をどのように構築できるか。
  • RQ3「but」や「and」などの文法的接続詞を組み込むことで、感情の反転を検出できるようになり、感情分類の精度がどの程度向上するか。
  • RQ4パス類似度のどのしきい値(tau)が、分類に適したバランスの取れた「良い」および「悪い」感性語集合を生成するか。

主な発見

  • 提案手法は、語彙の多様性が高く、感情キーワードの頻度が低い小規模ドキュメント(例:書評)において、bag-of-wordsモデルが失敗する状況でも分類性能が向上した。
  • WordNetのパス類似度(例:path_similarity(hit, slap) = 0.142)の活用により、意味的に関連する語の特定が可能になり、単なる頻度を超えた特徴表現が向上した。
  • tau 値を経験的に 0.8(良い)と 0.2(悪い)に設定することで、バランスの取れた感性語集合が得られ、分類時に一方のクラスに偏るのを防いだ。
  • Wikipediaのエントリから導出された頻度ベクトルは高いスパarsityを示しており、著者が類似した感情を表現するために多様な語彙を用いる傾向があることから、意味的アプローチが頻度ベースの手法に比べて必要であることが裏付けられた。
  • 「but」や「however」などの文法的手がかりの組み込みにより、感情の反転を検出でき、複文構造を考慮した分類精度の向上が見られた。
  • 事前に分類済みのドキュメントから得た初期の感性語集合の交差検証と、WordNetに基づく伝搬による拡張手法は、スケーラブルな特徴拡張に有望であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。