Skip to main content
QUICK REVIEW

[論文レビュー] Selective Text Augmentation with Word Roles for Low-Resource Text Classification

Biyang Guo, Songqiao Han|arXiv (Cornell University)|Sep 4, 2022
Text and Document Classification Technologies被引用数 6
ひとこと要約

本稿では、低リソーステキスト分類のための新しいデータ拡張手法である選択的テキスト拡張(STA)を提案する。STAは、統計的相関とテキストカテゴリとの類似性に基づいて、語を4つの役割—ゴールド、ベーシュ、ボーナス、トリビアル—に分類する。STAは、語の役割に応じてテキスト編集操作を選択的に適用することで、コアな意味を保持しながら多様で高品質な訓練サンプルを生成し、低リソースベンチマークで最大5%の精度向上を達成し、クロスデータセット一般化において4%以上の平均向上を示す。

ABSTRACT

Data augmentation techniques are widely used in text classification tasks to improve the performance of classifiers, especially in low-resource scenarios. Most previous methods conduct text augmentation without considering the different functionalities of the words in the text, which may generate unsatisfactory samples. Different words may play different roles in text classification, which inspires us to strategically select the proper roles for text augmentation. In this work, we first identify the relationships between the words in a text and the text category from the perspectives of statistical correlation and semantic similarity and then utilize them to divide the words into four roles -- Gold, Venture, Bonus, and Trivial words, which have different functionalities for text classification. Based on these word roles, we present a new augmentation technique called STA (Selective Text Augmentation) where different text-editing operations are selectively applied to words with specific roles. STA can generate diverse and relatively clean samples, while preserving the original core semantics, and is also quite simple to implement. Extensive experiments on 5 benchmark low-resource text classification datasets illustrate that augmented samples produced by STA successfully boost the performance of classification models which significantly outperforms previous non-selective methods, including two large language model-based techniques. Cross-dataset experiments further indicate that STA can help the classifiers generalize better to other datasets than previous methods.

研究の動機と目的

  • 非選択的テキスト拡張の限界、すなわちラベルを示す語を歪めたりノイズを強化したりするのを回避する。
  • 統計的相関と意味的類似性という2つの補完的視点を用いて、テキスト分類における語の機能的役割を特定・形式化する。
  • 語の役割に応じて異なる編集操作を適用する選択的拡張フレームワークを構築し、意味を保持しながら多様性を高める。
  • 特にデータ分布のシフトが生じるクロスデータセット設定において、モデルの一般化性能を向上させる。
  • 複数の低リソーステキスト分類ベンチマークで、非選択的拡張ベースラインを上回る、シンプルで効果的な手法を提供する。

提案手法

  • 各テキスト内の語は、統計的共起と意味的埋め込み類似性を用いて4つの役割に分類される:ゴールド(高相関、高類似性)、ベーシュ(高相関、低類似性)、ボーナス(低相関、高類似性)、トリビアル(低相関、低類似性)。
  • 統計的相関は、語の存在とカテゴリラベルとの間のピアソン相関係数(点二系列相関)で測定される。
  • 意味的類似性は、文-BERT埋め込みを用いて語の表現をカテゴリ記述と比較することで計算される。
  • STAは、語の役割に応じて異なるテキスト編集操作(置換、挿入、削除など)を適用する:ゴールド語は最小限に変更され、トリビアル語はより多く変更され、ベーシュ/ボーナス語は多様性向上を目的に選択的に編集される。
  • データセットの特性に応じて、グローバル戦略(高頻度の役割ベースのパターンを優先)またはローカル戦略(文ごとの個別判断)を用いて語を選択する。
  • 本手法は軽量であり、既存の拡張パイプラインと互換性があり、標準的なNLPモデルへの容易な統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1語とカテゴリ間の統計的相関と意味的類似性はどのように相互作用するのか?また、これらを用いてテキスト分類における意味のある語の役割を定義できるか?
  • RQ2語の役割に基づく選択的テキスト拡張は、非選択的手法と比較して、低リソーステキスト分類のモデル性能を向上させられるか?
  • RQ3拡張操作を語の役割に基づいて選択的に適用することで、コアな意味をどれだけ保持しながら訓練データの多様性を高められるか?
  • RQ4本手法STAは、トレーニングデータとテストデータの分布が異なる場合でも、異なるデータセットにどのように一般化するか?
  • RQ5統計的相関と意味的類似性のうち、拡張のための効果的な語の役割を決定する上で、どちらが相対的に寄与しているか?

主な発見

  • 50件のトレーニングサンプルしか利用できない状況でも、STAは低リソーステキスト分類タスクで平均でほぼ5%の精度向上を達成し、100件のサンプルでは2.6%の向上を示す。
  • 3つのベンチマークデータセットを用いたクロスデータセット一般化タスクにおいて、STAは非選択的ベースライン(EDA-w2v)を平均4%以上上回る。
  • アブレーションスタディの結果、語の役割特定時に統計的相関または意味的類似性を除去すると性能が低下し、特に意味的類似性が効果的な語の役割分類により大きな寄与をしていることが判明した。
  • クロスデータセット一般化において、STAは平均62.12%の精度を達成したのに対し、EDA-w2vは58.04%であった。これは、未観測のデータ分布への一般化能力が優れていることを示している。
  • 特にトリビアル語とボーナス語の編集を通じて、STAは訓練データのノイズ除去を効果的に行う。一方で、ゴールド語の意味的整合性は保持されている。
  • 結果から、ラベルの忠実性を維持しながらデータ多様性を高められる語の役割に依存する拡張は、非選択的手法よりもはるかに効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。