Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Document Clustering Based on BERT with Data Augment

Haoxiang Shi, Cen Wang|arXiv (Cornell University)|Nov 17, 2020
Text and Document Classification Technologies参考文献 30被引用数 6
ひとこと要約

本稿では、テキストクラスタリングのための自己教師付き対照学習(SCL)および少サンプル対照学習(FCL)フレームワークを提案する。このフレームワークは、BERTに基づき、非教師ありデータ拡張(UDA)を用いる。バックトランスレーションとランダムマスキングを活用して陽性サンプルを生成することで、SCLは短文および長文のクラスタリングベンチマークの両方で最先端の性能を達成する。一方、UDAを用いたFCLは、特に短文において教師あり学習の性能に非常に近い結果を示す。

ABSTRACT

Contrastive learning is a promising approach to unsupervised learning, as it inherits the advantages of well-studied deep models without a dedicated and complex model design. In this paper, based on bidirectional encoder representations from transformers, we propose self-supervised contrastive learning (SCL) as well as few-shot contrastive learning (FCL) with unsupervised data augmentation (UDA) for text clustering. SCL outperforms state-of-the-art unsupervised clustering approaches for short texts and those for long texts in terms of several clustering evaluation measures. FCL achieves performance close to supervised learning, and FCL with UDA further improves the performance for short texts.

研究の動機と目的

  • 複雑な生成的教師なしクラスタリングモデルの限界を克服するため、判別的対照学習アプローチを導入すること。
  • ラベル付きデータに依存せずに、短文および長文の両方のクラスタリング性能を向上させること。
  • 非教師ありデータ拡張(UDA)が、テキストクラスタリングにおける対照学習の性能向上に与える効果を調査すること。
  • 少数のラベル付き例を用いて、教師あり学習に近い性能を達成する少サンプル対照学習(FCL)の有効性を検証すること。
  • BERT表現を活用し、対照損失を組み合わせたスケーラブルでエンドツーエンドのフレームワークを構築すること。

提案手法

  • テキスト入力をBERTでエンコードし、クラスタリング用の密な潜在表現に変換する。
  • 自己教師付き対照学習(SCL)のための陽性ペアを生成するために、多言語のバックトランスレーション(BT)とランダムマスキング(RM)を適用する。
  • 少数のラベル付き例を用いて、同じクラスに属するペアを陽性ペアとして抽出する少サンプル対照学習(FCL)を採用する。
  • 表現間のコサイン類似度に基づく対照損失関数を用い、温度パラメータを用いてクラス内距離とクラス間距離を制御する。
  • 特に短文において性能向上を図るために、非教師ありデータ拡張(UDA)を統合する。
  • ファインチューニング後に、標準的なアルゴリズムを用いて最終的なBERTエンコード表現に対してクラスタリングを実行する。

実験結果

リサーチクエスチョン

  • RQ1BERTに基づく自己教師付き対照学習は、短文および長文のテキストデータセットにおいて、既存の教師なしクラスタリング手法を上回ることができるか?
  • RQ2少サンプル対照学習(FCL)は、どの程度教師あり学習の性能に近づけるか?
  • RQ3非教師ありデータ拡張(UDA)は、特に短文においてFCLの性能をどの程度向上させるか?
  • RQ4バックトランスレーションとランダムマスキングといった異なるデータ拡張戦略が、対照学習における陽性サンプル生成に与える影響は何か?
  • RQ5対照学習によるBERT表現と、従来のオートエンコーダーや生成的モデルとのクラスタリング効果を比較すると、どのような差異が生じるか?

主な発見

  • SCLは、NMI、AMI、ARI、BCubed F1といった複数の評価指標において、短文および長文のテキストデータセットで最先端のクラスタリング精度を達成した。
  • FCLは教師あり学習の性能に非常に近く、少サンプルの教師付き情報が対照学習において有効であることを示した。
  • 短文において、非教師ありデータ拡張(UDA)を用いたFCLは、さらにクラスタリング性能を向上させた。これは、データ拡張がリソースが限られた環境での一般化能力を高めることを示している。
  • バックトランスレーションとランダムマスキングをデータ拡張手法として用いることで、意味のある陽性サンプルを効果的に生成でき、対照学習の安定性と性能が向上した。
  • 温度スケーリングを用いた対照損失は、クラス内凝集性とクラス間分離性のバランスを適切に制御し、より優れたクラスタリング品質を実現した。
  • 本手法は、SIF + Autoencoder、G-BAT、SS-SB-MTといった強力なベースラインを、すべてのベンチマークデータセットで上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。