Skip to main content
QUICK REVIEW

[論文レビュー] One Embedder, Any Task: Instruction-Finetuned Text Embeddings

Hongjin Su, Weijia Shi|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用数 13
ひとこと要約

この論文では、下流タスクを自然言語で記述した指示に条件づけて、タスクおよびドメインに適した表現を生成する単一のテキスト埋め込みモデル、InstructORを紹介する。対照的学習を用いて人間がアノテートした指示を伴う330の多様なデータセットで訓練されたInstructORは、トレーニング中に見られなかった66のタスクを含む70の下流埋め込みタスクで最先端の性能を達成し、パrameter数335Mで前人最高のモデルを平均3.4%上回った。

ABSTRACT

We introduce INSTRUCTOR, a new method for computing text embeddings given task instructions: every text input is embedded together with instructions explaining the use case (e.g., task and domain descriptions). Unlike encoders from prior work that are more specialized, INSTRUCTOR is a single embedder that can generate text embeddings tailored to different downstream tasks and domains, without any further training. We first annotate instructions for 330 diverse tasks and train INSTRUCTOR on this multitask mixture with a contrastive loss. We evaluate INSTRUCTOR on 70 embedding evaluation tasks (66 of which are unseen during training), ranging from classification and information retrieval to semantic textual similarity and text generation evaluation. INSTRUCTOR, while having an order of magnitude fewer parameters than the previous best model, achieves state-of-the-art performance, with an average improvement of 3.4% compared to the previous best results on the 70 diverse datasets. Our analysis suggests that INSTRUCTOR is robust to changes in instructions, and that instruction finetuning mitigates the challenge of training a single model on diverse datasets. Our model, code, and data are available at https://instructor-embedding.github.io.

研究の動機と目的

  • 既存のテキスト埋め込みモデルが新しいタスクやドメインにおいて一般化性能が低いという問題に対処すること。
  • タスクおよびドメインの指示が、追加の微調整なしに効果的で特化した埋め込みを生成できるかどうかを検証すること。
  • 多様な下流アプリケーションで良好に動作する統合的で指示微調整済みの埋め込みモデルを開発すること。
  • 指示ベースの微調整が、多様なデータセットにおける頑健性と性能を向上させることを実証すること。

提案手法

  • InstructORは、入力テキストとそのタスクまたはドメインを記述する自然言語の指示をエンコードし、タスクに適した埋め込みを生成する。
  • 対照的損失を用いて、330の多様なテキスト埋め込みデータセットのマルチタスク混合データセットでモデルを訓練し、意味的に関連するペア間の類似度を最大化する。
  • MEDIデータセットは、各入力ペアに対して人間が書いたタスクおよびドメインの記述を含む330の指示アノテート済みデータセットから構成される。
  • シアンペインネットワークアーキテクチャを用いて、テキスト-指示ペアの埋め込みを計算し、対照的損失が意味的類似度を最適化する。
  • 分類、検索、クラスタリング、意味的類似度タスクを含む70の下流埋め込みベンチマークでモデルを評価する。
  • GTR や SimCSE などの先行最先端モデルと性能を比較し、指示微調整の貢献を分離するためのアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1単一のテキスト埋め込みモデルが、自然言語の指示のみを用いて高品質なタスク固有の表現を生成できるか?
  • RQ2指示ベースの微調整が、多様な下流タスクおよびドメインにおけるゼロショット一般化を向上させるか?
  • RQ3指示微調整は、同じタスク記述の言い換えや異なるフォーマットに対してどれほど頑健か?
  • RQ4335Mパラメータの小さなモデルが、指示の監視で訓練された場合、15億パラメータの大きなモデルを上回る性能を発揮できるか?
  • RQ5指示微調整は、多様なデータセットにおける分布シフトをどれほど軽減できるか?

主な発見

  • InstructORは、トレーニング中に見られなかった66のタスクを含む70の多様な下流埋め込みタスクで、前人最高のモデルを平均3.4%上回った。
  • パラメータ数が335Mにとどまっているにもかかわらず、InstructORは70の評価タスクのうち63で15億パラメータのGTRモデルを上回った。
  • InstructORは、同じタスク記述の言い換えに頑健で、異なる指示フォーマットに対しても性能が安定している。
  • アブレーションスタディにより、指示微調整が不可欠であることが確認された。指示なしで訓練した場合、著しく性能が低下した。
  • InstructORは、MTEBベンチマークの全カテゴリ—検索、分類、クラスタリング、意味的テキスト類似度—で最先端の結果を達成した。
  • 特に医療や金融などリソースが限られたドメインでも優れたゼロショット転送能力を示し、優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。