Skip to main content
QUICK REVIEW

[論文レビュー] One-shot and few-shot learning of word embeddings

Andrew K. Lampinen, James L. McClelland|arXiv (Cornell University)|Oct 27, 2017
Topic Modeling参考文献 8被引用数 12
ひとこと要約

本論文では、文脈文と過去の経験からのネガティブサンプルを用いて勾配降下法で最適化することで、新しい単語の埋め込みベクトルのみを微調整し、他のすべてのネットワーク重みを固定する手法を提案する。このアプローチにより、大幅に少ないデータで、かつ既存の知識への干渉を最小限に抑えて、完全再訓練と同等の性能を達成する。

ABSTRACT

Standard deep learning systems require thousands or millions of examples to learn a concept, and cannot integrate new concepts easily. By contrast, humans have an incredible ability to do one-shot or few-shot learning. For instance, from just hearing a word used in a sentence, humans can infer a great deal about it, by leveraging what the syntax and semantics of the surrounding words tells us. Here, we draw inspiration from this to highlight a simple technique by which deep recurrent networks can similarly exploit their prior knowledge to learn a useful representation for a new word from little data. This could make natural language processing systems much more flexible, by allowing them to learn continually from the new words they encounter.

研究の動機と目的

  • 深層学習システムが、人間のワンショット学習能力を模倣して、たった一つまたは数個の例からのみ新しい単語の意味を学習できるようにすること。
  • 初期学習後、新しい単語への一般化ができない標準的な単語埋め込みモデルの限界を解決すること。
  • 以前に学習した知識の完全な忘却なしに、新しい単語表現を統合する手法を開発すること。
  • 事前学習済みネットワークが、最小限の文脈から、まれなまたは未観測の単語の意味的表現を推論できるかどうかを検討すること。

提案手法

  • 新しい単語の埋め込みベクトル以外のすべてのネットワーク重みを固定し、学習中に更新可能なのはこれらのベクトルのみとする。
  • 確率的勾配降下法を用い、学習率0.01で、新しい単語の埋め込みを100エポックにわたり、その単語を含む文で最適化する。
  • 過去の経験から得たネガティブサンプルを組み込むことで、少数の訓練例への過剰適合を防ぎ、一般化性能を向上させる。
  • 新しい単語の埋め込みを、使用頻度が極めて低いトークンの埋め込み、ゼロベクトル、または周囲の単語埋め込みの重心の3つの戦略で初期化する。
  • 最適化ベースの手法と重心ベースの初期化、および全コーパスの完全再訓練との性能を比較する。
  • 100個の新しい単語からなるテストセットで評価し、パープレキシティの向上と未観測文脈への一般化性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの深層ネットワークは、たった1〜2文の情報のみで、新しい単語の意味的表現を適切に学習できるか?
  • RQ2他のすべての重みを固定し、新しい単語の埋め込みのみを微調整する方法は、災難的忘却を防ぎ、既存の知識を保持できるか?
  • RQ3提案手法の最適化法の性能は、単純な重心初期化法や完全再訓練法と比べてどの程度優れているか?
  • RQ4この手法は、ネットワークの既存知識と意味的・構文的に整合性を持つ単語に対して、どの程度一般化できるか?

主な発見

  • 重心からの最適化手法は、重心ベースラインより平均で64%(11パーセンテージポイント)のパープレキシティ低下を達成し、性能が悪化した例は一切なかった。
  • 対応t検定により、改善は極めて有意であった(t(99) = -20.5, p < 1×10⁻¹⁶)。
  • 訓練データが2.5%少ないにもかかわらず、提案手法は完全再訓練と同等の性能を示し、性能に有意差は認められなかった(t(99) = 0.9, p = 0.39)。
  • この手法は、事前学習済みネットワークが持つ構文的・意味的知識を効果的に活用し、新しい単語の文脈に適した埋め込みを生成した。
  • 多様な単語と文脈に対して高いロバスト性を示したため、単なるベクトル平均化を越えた言語の構造的パターンを捉えている可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。