Skip to main content
QUICK REVIEW

[論文レビュー] Aggressive Sampling for Multi-class to Binary Reduction with Applications to Text Classification

Bikash Joshi, Massih-Réza Amini|arXiv (Cornell University)|Jan 23, 2017
Text and Document Classification Technologies参考文献 1被引用数 7
ひとこと要約

本稿では、長尾クラス分布下でも効率性と一貫性を向上させるために、大規模な多クラステキスト分類を二値分類に還元するためのダブルサンプリング戦略を提案する。少数クラスのオーバーサンプリングと多数クラスのサブサンプリングにより、クラス分布をバランスさせ、削減された対のペア集合を構築する。この手法により、最大10万クラスのデータセットにおいて、メモリ使用量と学習時間を著しく削減した状態で最先端の性能を達成した。

ABSTRACT

We address the problem of multi-class classification in the case where the number of classes is very large. We propose a double sampling strategy on top of a multi-class to binary reduction strategy, which transforms the original multi-class problem into a binary classification problem over pairs of examples. The aim of the sampling strategy is to overcome the curse of long-tailed class distributions exhibited in majority of large-scale multi-class classification problems and to reduce the number of pairs of examples in the expanded data. We show that this strategy does not alter the consistency of the empirical risk minimization principle defined over the double sample reduction. Experiments are carried out on DMOZ and Wikipedia collections with 10,000 to 100,000 classes where we show the efficiency of the proposed approach in terms of training and prediction time, memory consumption, and predictive performance with respect to state-of-the-art approaches.

研究の動機と目的

  • Wikipedia や DMOZ のような、非常に多数のクラスを有する極端な多クラステキスト分類の課題に対処すること。
  • 現実のテキストデータセットに一般的に見られる長尾クラス分布に起因する課題を克服すること。
  • 多クラスから二値分類への還元における対のペア構築の計算コストを、一般化性能を損なわず低減すること。
  • サンプリングに起因する分布シフトとペア間の依存性に対しても、経験的リスク最小化の一貫性を保証すること。
  • 極端な多クラス設定において、予測性能、学習時間、メモリ消費量の良好なトレードオフを達成すること。

提案手法

  • まず、元の学習セットにおいて少数クラスをオーバーサンプリングし、多数クラスをサブサンプリングすることでクラス分布をバランスさせるダブルサンプリング戦略を適用する。
  • 再サンプリングされたセットから、各インスタンスをその真のクラスと、ランダムに抽出された負例クラスとペアにする、削減された対の例の集合を構築する。
  • 削減された対のデータセット上で学習された二値分類器を用い、与えられた(インスタンス, クラス)ペアが正例(真のラベル)か負例(誤ったラベル)かを予測する。
  • 局所的分数階レーディンガー複雑度を用いた理論的枠組みを導入し、変換されたサンプリング済み分布下での経験的リスク最小化の一貫性を証明する。
  • 例とクラスの両方の類似度に基づく特徴表現を活用し、二値還元空間における一般化性能を向上させる。
  • 同じインスタンスと真のクラスを共有するペア間の依存性を、一般化限界において形式的に取り扱う。

実験結果

リサーチクエスチョン

  • RQ1極端な多クラス設定における多クラスから二値分類への還元の効率性を、学習インスタンスおよび負例クラスの積極的サンプリングによって向上させることができるか?
  • RQ2分布シフトとペア間の依存性が生じる中でも、提案されたサンプリング戦略が経験的リスク最小化の一貫性を保持できるか?
  • RQ3大規模なテキスト分類ベンチマークにおいて、学習時間、メモリ使用量、予測性能の観点から、最先端の手法と比較してどのように差がつくか?
  • RQ4現実のテキストデータセットにおける長尾クラス分布の悪影響を、この手法はどの程度軽減できるか?
  • RQ55万~10万クラスのデータセットに対して、高い正確性と低いリソース消費量を維持したまま、スケーラブルに拡張できるか?

主な発見

  • 10万クラスを有する Wikipedia-100K データセットにおいて、提案手法 $(\boldsymbol{\nu},\boldsymbol{\rho})$-DS は25%の正確度と17.8%のマクロF1を達成し、OVA、M-SVM、FastXML を上回った。
  • Wikipedia-100K では、学習時間を9,264秒、メモリ使用量を9.8 GBにまで削減したが、OVA や M-SVM では1000 GBを超える使用量を要した。
  • Wikipedia-50K では、予測時間37.23秒で33.8%の正確度と23.4%のマクロF1を達成し、木構造ベースの手法を著しく上回った。
  • $(\boldsymbol{\nu},\boldsymbol{\rho})$-DS 手法は、実行時間、メモリ使用量、パフォーマンスの総合的なトレードオフが最も優れており、高メモリ使用量である PD-Sparse 即ち、それも上回った。
  • FastXML や RecallTree といった木構造ベースの手法は、誤りの累積が生じ、推論は速いものの正確度が低く(例:DMOZ では15.6%)、悪影響を受けていた。
  • 局所的分数階レーディンガー複雑度を用いた理論的境界によって検証されたように、積極的サンプリング下でも高い一貫性と一般化性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。