Skip to main content
QUICK REVIEW

[論文レビュー] An Unsupervised Sentence Embedding Method byMutual Information Maximization

Yan Zhang, Ruidan He|arXiv (Cornell University)|Sep 25, 2020
Topic Modeling参考文献 45被引用数 5
ひとこと要約

本稿では、ラベルなしデータを用いて文の埋め込みを意味のあるものに学習するための軽量で自己教師ありの手法を提案する。文のペア間の相互情報量を最大化することで、自己教師あり文書類似度および下流タスクで最先端の性能を達成し、低リソースドメインにおいてもSBERTを上回る性能を示す。

ABSTRACT

BERT is inefficient for sentence-pair tasks such as clustering or semantic search as it needs to evaluate combinatorially many sentence pairs which is very time-consuming. Sentence BERT (SBERT) attempted to solve this challenge by learning semantically meaningful representations of single sentences, such that similarity comparison can be easily accessed. However, SBERT is trained on corpus with high-quality labeled sentence pairs, which limits its application to tasks where labeled data is extremely scarce. In this paper, we propose a lightweight extension on top of BERT and a novel self-supervised learning objective based on mutual information maximization strategies to derive meaningful sentence embeddings in an unsupervised manner. Unlike SBERT, our method is not restricted by the availability of labeled data, such that it can be applied on different domain-specific corpus. Experimental results show that the proposed method significantly outperforms other unsupervised sentence embedding baselines on common semantic textual similarity (STS) tasks and downstream supervised tasks. It also outperforms SBERT in a setting where in-domain labeled data is not available, and achieves performance competitive with supervised methods on various tasks.

研究の動機と目的

  • 文のペア処理におけるBERTの非効率性(組み合わせ的ペア評価のコスト)を解消すること。
  • SBERTが高品質なラベル付き文のペアに依存する点を克服し、低リソース環境での適用可能性を向上させること。
  • ドメイン固有のラベルなしコーパスで効果的に動作する自己教師あり文の埋め込み手法を開発すること。
  • ラベルなしデータを必要とせずに、自己教師あり文書類似度および下流タスクでの性能を向上させること。

提案手法

  • 文レベルの表現を学習するため、BERTに軽量なアダプタモジュールを拡張する。
  • 文のペア間の相互情報量最大化に基づく、新しい自己教師あり学習目的関数を導入する。
  • 対照的学習の原則に従い、類似した意味の文を一致させ、類似しない文を分離するようにモデルを訓練する。
  • 自己教師あり事前学習中の訓練の安定性を高めるためにモーメンタムエンコーダーを用いる。
  • 人手によるラベル付きペアに依存せずに、頑健な文の表現を相互情報量目的関数を用いて学習する。
  • 相互情報量推定に基づく対照的損失を最適化することで、エンドツーエンドでモデルを最適化する。

実験結果

リサーチクエスチョン

  • RQ1相互情報量最大化は、自己教師ありの文の埋め込み学習に効果的に活用可能か?
  • RQ2本手法は、文書類似度タスクにおける既存の自己教師あり文の埋め込みベースラインと比較して、どのように性能を発揮するか?
  • RQ3ラベル付きデータが乏しい低リソースドメインに、どの程度一般化可能か?
  • RQ4ドメイン内ラベル付きデータが存在しない状況でも、本手法はSBERTのような教師あり手法と同等の性能を達成できるか?

主な発見

  • 提案手法は、標準的な文書類似度(STS)ベンチマークにおいて、既存の自己教師あり文の埋め込みベースラインを顕著に上回る性能を発揮する。
  • ラベルなしデータを一切使用しない状況でも、さまざまな下流タスクで教師あり手法と同等の性能を達成する。
  • ドメイン内ラベル付きデータが存在しない状況では、SBERTを上回り、優れたゼロショット一般化性能を示す。
  • 自己教師ありSTSタスクにおいて、最先端の結果を達成しており、相互情報量最大化が自己教師あり学習に有効であることを裏付けている。
  • 効率的かつスケーラブルであり、BERTの文のペア処理における組み合わせ的コストを回避する。
  • 自己教師ありの性質とラベル付きペアへの依存のなさのおかげで、異なるドメイン固有のコーパスにうまく一般化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。