Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Multiclass Decompositions with Application to Authorship Determination

Ran El‐Yaniv, Noam Etzion-Rosenberg|arXiv (Cornell University)|Oct 11, 2010
Authorship Attribution and Profiling参考文献 20被引用数 4
ひとこと要約

本稿では、Jensen-Shannon発散に基づくベイズ誤り率の上限・下限を用いて、統計的に「簡単な」二値部分問題を構築するための貪欲ヒューリスティックを誘導する、多項分類問題の階層的マルチクラス分解手法を提案する。著者識別ベンチマーク上で評価された結果、クラス数が少ない場合に、すべてのペア分解法を上回り、SVMと高頻度トークンペア特徴量を用いて50人の著者では最大91%の正確さ、100人の著者では88%の正確さを達成した。

ABSTRACT

This paper is mainly concerned with the question of how to decompose multiclass classification problems into binary subproblems. We extend known Jensen-Shannon bounds on the Bayes risk of binary problems to hierarchical multiclass problems and use these bounds to develop a heuristic procedure for constructing hierarchical multiclass decomposition for multinomials. We test our method and compare it to the well known "all-pairs" decomposition. Our tests are performed using a new authorship determination benchmark test of machine learning authors. The new method consistently outperforms the all-pairs decomposition when the number of classes is small and breaks even on larger multiclass problems. Using both methods, the classification accuracy we achieve, using an SVM over a feature set consisting of both high frequency single tokens and high frequency token-pairs, appears to be exceptionally high compared to known results in authorship determination.

研究の動機と目的

  • 多クラス分類問題を二値部分問題に分解する統計的に最適な方法を提示すること。
  • 「1対rest」と「すべてのペア」のような既存のフラット分解法を改善するため、階層的構造を導入すること。
  • ベイズ誤り率に関する情報理論的上限を根拠としたヒューリスティックを開発し、階層的分解を構築すること。
  • 新規に開発された高精度な著者識別ベンチマークを用いて、本手法の実験的評価を行うこと。

提案手法

  • Jensen-Shannon発散を用いて、階層的マルチクラス分解におけるベイズ誤り率の上限および下限を導出する。
  • これらの上限・下限を最適性指標として用い、階層的二値木の構築を誘導する貪欲ヒューリスティックを適用する。
  • 多項分布における最尤推定を用いて、潜在的なクラス確率を近似する。
  • ソフトな信頼度付き分類器とパス確率デコーディング法を用い、最も確率の高いリーフクラスを選択する。
  • 上位5000個の単一トークンおよび高頻度トークンペアを用いて、高次の言語統計を捉える特徴量集合を構築する。
  • 分類にSVM(RBFカーネル)と3分割交差検証を用い、ハイパーパramータは交差検証により最適化する。

実験結果

リサーチクエスチョン

  • RQ1階層的マルチクラス分解は、分類精度の観点から、'すべてのペア'のようなフラット分解法を上回ることができるか?
  • RQ2ベイズ誤り率に関する情報理論的上限は、効果的な階層的二値部分問題の構築をどのように誘導するか?
  • RQ3クラス数の増加に伴って、本手法は高い性能を維持できるか?
  • RQ4本手法の貪欲ヒューリスティックによって生成された最良の階層的木が常に偏った構造を示すのはなぜか?これはヒューリスティックの弱さの兆候なのか、モデルのアーチファクトなのか?
  • RQ5すべてのペア法のO(k²)の計算量と比較して、階層的分解は大規模なマルチクラス問題にどの程度スケーリング可能か?

主な発見

  • 階層的分解手法は、小規模なマルチクラス問題(k ≤ 20)において、常にすべてのペア法を上回る性能を示し、高い正確さを達成した。
  • 50人の著者では、階層的手法が91%の分類正確さを達成し、著者識別分野における一般的な結果を著しく上回った。
  • 100人の著者では、階層的手法が88%の正確さを達成し、再び既知のベンチマークを上回った。
  • クラス数が大きくなる(k > 10)と、階層的手法とすべてのペア法との性能差は縮まり、以降は有意差は観察されなかった。
  • 本手法の貪欲ヒューリスティックによって生成された最良の階層的木は、一貫して偏った構造を示し、現行の貪欲ヒューリスティックに潜在的な制限やバイアスがある可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。