Skip to main content
QUICK REVIEW

[論文レビュー] LightXML: Transformer with Dynamic Negative Sampling for High-Performance Extreme Multi-label Text Classification

Ting Jiang, Deqing Wang|arXiv (Cornell University)|Jan 9, 2021
Text and Document Classification Technologies参考文献 23被引用数 14
ひとこと要約

LightXML は、生成的協調ネットワークによる動的ネガティブサンプリングを用いた、エンド・ツー・エンドで軽量なトランスフォーマー基盤モデルを提案する。テキスト表現、ラベルリコール、ラベルランク付けを一つの統合フレームワークで同時に最適化することで、AttentionXML や X-Transformer よりも最大72%小さいモデルサイズと顕著に低い計算コストで、5つのベンチマークデータセットにおいて最先端の性能を達成した。

ABSTRACT

Extreme Multi-label text Classification (XMC) is a task of finding the most relevant labels from a large label set. Nowadays deep learning-based methods have shown significant success in XMC. However, the existing methods (e.g., AttentionXML and X-Transformer etc) still suffer from 1) combining several models to train and predict for one dataset, and 2) sampling negative labels statically during the process of training label ranking model, which reduces both the efficiency and accuracy of the model. To address the above problems, we proposed LightXML, which adopts end-to-end training and dynamic negative labels sampling. In LightXML, we use generative cooperative networks to recall and rank labels, in which label recalling part generates negative and positive labels, and label ranking part distinguishes positive labels from these labels. Through these networks, negative labels are sampled dynamically during label ranking part training by feeding with the same text representation. Extensive experiments show that LightXML outperforms state-of-the-art methods in five extreme multi-label datasets with much smaller model size and lower computational complexity. In particular, on the Amazon dataset with 670K labels, LightXML can reduce the model size up to 72% compared to AttentionXML.

研究の動機と目的

  • マルチステージ学習と静的ネガティブサンプリングに依存する従来の XMC 手法が示す非効率さと高い計算コストを是正すること。
  • 極端に多数のラベルを含む状況において、分類精度を維持または向上させながら、モデルサイズと計算複雑性を低減すること。
  • テキスト表現、ラベルリコール、ラベルランク付けを統合的に最適化する一貫したフレームワークに統合することで、トランスフォーマー基盤モデルのエンド・ツー・エンド学習を可能にすること。
  • 学習中に適応的に変化する動的ネガティブサンプリング戦略を開発し、モデルのロバストネスと収束性を向上させること。
  • 1枚の GPU を用いて、最小限の学習時間で大規模データセット(例:Amazon-670K)において高い性能を達成すること。

提案手法

  • LightXML は、入力テキストから豊富で階層的なテキスト表現を生成するためのマルチレイヤー・トランスフォーマー・エンコーダーを採用する。
  • ラベルジェネレータ(正例および負例ラベルのリコール用)とディスクラミネータ(ラベルを正例または負例としてランク付け用)から成る生成的協調ネットワークを導入する。
  • トレーニング中に、同じテキスト表現をジェネレータに供給することで、ディスクラミネータが多様で変化するネガティブラベルの集合から学習できるように、動的ネガティブサンプリングを実施する。
  • エンド・ツー・エンドの学習により、テキスト表現、ラベルリコール、ラベルランク付けの同時最適化が可能となり、別々のモデル学習段階を必要としなくなる。
  • ラベルジェネレータはラベルクラスタ情報を利用してリコール品質を向上させる一方、ディスクラミネータは真の正例ラベルとリコールされたラベルを区別する。
  • 推論は効率的であり、50万以上のラベルを含むデータセットにおいて、1サンプルあたり5ms未満の予測時間が達成できる。

実験結果

リサーチクエスチョン

  • RQ1XMC におけるトランスフォーマー基盤モデルのエンド・ツー・エンド学習は、精度と効率の面でマルチステージ学習手法を上回ることができるか?
  • RQ2生成的・判別的フレームワーク内で学習される動的ネガティブサンプリングは、静的サンプリングと比較して、モデルの一般化性能と収束性を向上させるか?
  • RQ3単一の統合モデルが、モデルサイズと計算コストを低減させながら、極端に多数のラベルを含むデータセットで最先端の性能を達成できるか?
  • RQ4トランスフォーマー・エンコーダーによるマルチレイヤーのテキスト表現は、XMC における収束速度と最終的な精度にどのように影響を与えるか?
  • RQ5AttentionXML や X-Transformer ような最先端手法と比較して、LightXML はモデルサイズと推論時間をどの程度削減できるか?

主な発見

  • Amazon-670K データセットにおいて、LightXML は AttentionXML よりも72%小さいモデルサイズを実現し、同じかそれ以上の性能を達成しながら、顕著に低いメモリ使用量を実現した。
  • Amazon-670K において、LightXML は1サンプルあたり4.09msの予測速度を達成し、AttentionXML の8.59msと比較して52%の高速化を実現した。
  • Amazon-670K において、LightXML は1枚の GPU を使用して28.75時間の学習時間に抑えたのに対し、AttentionXML は26.10時間であった。
  • マルチレイヤーのテキスト表現を用いることで、最後のレイヤーの [CLS] テンキーのみを用いる場合と比較して、最終的な P@5 精度が1%以上向上した。
  • 動的ネガティブサンプリングは、静的サンプリングの変種($S$ および $BS$)を上回り、長時間の学習を要するにもかかわらず、精度と学習効率の両面で優れた性能を示した。
  • LightXML は、Wiki-500K や Amazon-670K を含む5つのベンチマークデータセットにおいて、最小限の計算コストと完全な1GPU互換性を備えた状態で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。