Skip to main content
QUICK REVIEW

[論文レビュー] CBOW Is Not All You Need: Combining CBOW with the Compositional Matrix Space Model

Florian Mai, Lukas Galke|arXiv (Cornell University)|Feb 18, 2019
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、語の内容記憶の強みを補完する形で語順の意識を組み込むために行列乗算を用いることで、順序に配慮した単語表現を強化する非教師ありで効率的な訓練手法であるCMOWを提案する。CBOWの語の内容記憶力と相補的な特徴を有する。ハイブリッドなCBOW-CMOWモデルは、言語的探査タスクで平均8%の向上を達成し、11の教師あり下流タスクで平均1.2%の向上を示す。

ABSTRACT

Continuous Bag of Words (CBOW) is a powerful text embedding method. Due to its strong capabilities to encode word content, CBOW embeddings perform well on a wide range of downstream tasks while being efficient to compute. However, CBOW is not capable of capturing the word order. The reason is that the computation of CBOW's word embeddings is commutative, i.e., embeddings of XYZ and ZYX are the same. In order to address this shortcoming, we propose a learning algorithm for the Continuous Matrix Space Model, which we call Continual Multiplication of Words (CMOW). Our algorithm is an adaptation of word2vec, so that it can be trained on large quantities of unlabeled text. We empirically show that CMOW better captures linguistic properties, but it is inferior to CBOW in memorizing word content. Motivated by these findings, we propose a hybrid model that combines the strengths of CBOW and CMOW. Our results show that the hybrid CBOW-CMOW-model retains CBOW's strong ability to memorize word content while at the same time substantially improving its ability to encode other linguistic information by 8%. As a result, the hybrid also performs better on 8 out of 11 supervised downstream tasks with an average improvement of 1.2%.

研究の動機と目的

  • CBOWが可換なベクトル加算のため、語順を捉えられないという問題を解決する。
  • 行列に基づく単語表現を用いた、Compositional Matrix Space Model (CMSM) のための、初めての非教師ありでスケーラブルな訓練スキームを開発する。
  • CBOWとCMOWの相補的な特徴を組み合わせたハイブリッドモデルを構築し、CBOWの語の内容記憶力は維持しつつ、言語的構造の符号化を向上させる。
  • CBOWとCMOWの相補的な特徴を、言語的探査タスクおよび下流NLPタスクにおいて実証的に評価する。

提案手法

  • CBOWの目的関数と初期化戦略を単語ベクトルから単語行列へ適応させ、シーケンスの構成に行列乗算を可能にする。
  • 非可換性を持つ行列乗算を合成演算として用いることで、語順の情報が保持される。
  • 大規模なラベルなしテキスト上で、行列表現に特化した変更版skip-gramに類似した目的関数を用いて、エンドツーエンドでモデルを訓練する。
  • ハイブリッドアーキテクチャにおいて、CBOWとCMOWの埋め込みを同時に学習するための共同訓練スキームを導入する。
  • 効率的なGPU加速による行列乗算を適用し、高い推論速度を維持する。1秒間に約71,000文の処理が可能である。
  • 頻出ビグラムの事前計算と動的計画法を用いて、逐次的乗算ステップの数を削減する。

実験結果

リサーチクエスチョン

  • RQ1CBOWに類似した目的関数を用いて、大規模な非教師あり設定でCompositional Matrix Space Modelを効果的に訓練できるか?
  • RQ2CMOWの言語的表現能力は、語順の感受性と内容記憶の観点からCBOWと比べてどの程度優れているか?
  • RQ3CBOWとCMOWを組み合わせることで、単体のモデルと比較して下流NLPタスクの性能がどの程度向上するか?
  • RQ4語順の意識が求められるタスク、例えばセンチメント分析や質問分類において、ハイブリッドモデルがより優れた性能を発揮するか?

主な発見

  • ハイブリッドなCBOW-CMOWモデルは、CBOW単体と比較して、言語的探査タスクで平均8%の性能向上を達成した。
  • 11の教師あり下流タスクにおいて、ハイブリッドモデルはCBOWを平均1.2%上回った。特にセンチメント分析(SST2, SST5)と質問分類(TREC)で顕著な向上が見られた。
  • CMOWは語順や文法的構造といった言語的性質を優れて捉えるが、語の内容記憶タスクではCBOWがCMOWを上回る。
  • ハイブリッドモデルは、CBOWの強力な語の内容記憶力は維持しつつ、言語的構造の符号化能力を著しく向上させた。
  • CMOWは1秒間に約71,000文の符号化速度を達成し、CBOWの61,000と比較して同等の性能を示しており、大規模応用に適している。
  • 11の下流タスクのうち8つでハイブリッドモデルがCBOWを上回った。CBOWがわずかに優れる2つのタスクでは、性能低下が0.6%にとどまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。