Skip to main content
QUICK REVIEW

[論文レビュー] Transformers are Short Text Classifiers: A Study of Inductive Short Text Classifiers on Benchmarks and Real-world Datasets

Fabian Karl, Ansgar Scherp|arXiv (Cornell University)|Nov 30, 2022
Topic Modeling被引用数 8
ひとこと要約

この論文は、短いテキスト分類タスクにおけるトランスフォーマー(特に BERT および RoBERTa)の性能を調査し、専用の短いテキストモデルと比較している。実証的に、純粋なトランスフォーマーがベンチマークおよび実世界のデータセットにおいて最先端の正確性を達成しており、短いテキストタスクにおいてドメイン特化アーキテクチャの必要性を疑問視している。

ABSTRACT

Short text classification is a crucial and challenging aspect of Natural Language Processing. For this reason, there are numerous highly specialized short text classifiers. However, in recent short text research, State of the Art (SOTA) methods for traditional text classification, particularly the pure use of Transformers, have been unexploited. In this work, we examine the performance of a variety of short text classifiers as well as the top performing traditional text classifier. We further investigate the effects on two new real-world short text datasets in an effort to address the issue of becoming overly dependent on benchmark datasets with a limited number of characteristics. Our experiments unambiguously demonstrate that Transformers achieve SOTA accuracy on short text classification tasks, raising the question of whether specialized short text techniques are necessary.

研究の動機と目的

  • 最先端のトランスフォーマーが短いテキスト分類タスクにどの程度効果的であるかを評価すること。
  • 一般用途のトランスフォーマーモデルと、特定の短いテキストモデル(例:GNNベース、RNN、CNN)を比較すること。
  • 税務監査および電子商取引のユースケースにインspiredされた2つの新しい実世界データセット(NICE および STOPS)を導入すること。
  • 現在のベンチマークデータセットが、耐性および一般化性能の評価に十分であるかどうかを評価すること。
  • 短いテキスト分類において、専用モデルが不可欠であるという仮定に疑問を呈すること。

提案手法

  • BERT、RoBERTa、DistilBERT、ALBERTv2、およびグラフニューラルネットワーク(例:InducT-GCN、SHINE、ConTextING-RoBERTa)を含む多様なモデルを評価した。
  • R8、Snippets、Twitter、TREC、MR などの短いテキストデータセットに対して、トランスフォーマーの標準的なファインチューニングプロトコルを用いた。
  • 2つの新しい実世界データセット(NICE:45クラスの商品・サービス分類、STOPS:AmazonおよびYelpの商品・サービス記述)を導入した。
  • ベンチマークデータセットおよび新しい実世界データセットの両方で実験を行い、一般化性能および耐性を評価した。
  • GNNモデル(例:SHINE、InducT-GCN)の結果に高いばらつきが見られたため、ランダム初期化に起因するばらつきを考慮するために、複数回の実行結果を報告した。
  • 主に正確度を指標としてモデル性能を比較し、モデル効率分析のためのパラメータ数も報告した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みトランスフォーマーは、専用の短いテキストモデルと比較して、短いテキスト分類タスクで最先端の性能を達成するか?
  • RQ2複雑でドメイン特化された特徴を有する実世界の短いテキストデータセットにおいて、トランスフォーマーは標準ベンチマークにない特徴を有するデータセットでも性能を発揮するか?
  • RQ3NICE データセットは、将来的な短いテキスト分類研究のための十分に挑戦的であると見なせるか?
  • RQ4アーキテクチャの違いがあるにもかかわらず、一般用途のトランスフォーマーモデルは、GNN や RNN などの専用アーキテクチャを上回る性能を示せるか?
  • RQ5モデルのハイパーパrameterおよびパラメータ数は、短いテキスト分類の性能にどの程度影響を及えるか?

主な発見

  • 特に RoBERTa および DeBERTa は、R8、Snippets、Twitter、TREC を含むすべてのベンチマークデータセットで最先端の正確度を達成した。
  • DistilBERT(6600万パラメータ)および ALBERTv2(1200万パラメータ)のような小型バージョンでさえ、WideMLP(3130万パラメータ)のような大規模なBoWベースのモデルを上回った。
  • NICE-45 データセットはすべてのモデルにとって特に挑戦的であり、将来的な研究のための堅牢なベンチマークとしての価値があることを示した。
  • グラフベースのモデル(例:ConTextING-RoBERTa、InducT-GCN)は競争力のある性能を示したが、純粋なトランスフォーマーモデルに到達できなかった。
  • SHINE は実行回数ごとの性能に著しいばらつきを示し、GNN が短いテキスト設定において不安定であることを示し、結果の解釈を過剰に信頼すべきでないことを警告した。
  • STOPS データセット(実世界のAmazonおよびYelpデータから抽出)は、ビジネス関連の短いテキスト分類にトランスフォーマーを適用可能なことを示し、高い正確度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。