[論文レビュー] Nomic Embed: Training a Reproducible Long Context Text Embedder
本技術報告は、nomic-embed-text-v1 を提示します。オープンソースの、8192トークンの長文-context テキスト埋め込みモデルで、137M パラメータを持ち、短文・長文コンテキストのベンチマークで OpenAI ada-002 および text-embedding-3-small を上回ります。さらに、完全に監査可能な学習データ、コード、ウェイトを提供します。
This technical report describes the training of nomic-embed-text-v1, the first fully reproducible, open-source, open-weights, open-data, 8192 context length English text embedding model that outperforms both OpenAI Ada-002 and OpenAI text-embedding-3-small on the short-context MTEB benchmark and the long context LoCo benchmark. We release the training code and model weights under an Apache 2.0 license. In contrast with other open-source models, we release the full curated training data and code that allows for full replication of nomic-embed-text-v1. You can find code and data to replicate the model at https://github.com/nomic-ai/contrastors.
研究の動機と目的
- 完全に再現可能な長文-context テキスト埋め込みモデルを、監査可能なデータ、ウェイト、コードとともに実証する。
- nomic-embed-text-v1 が短文および長文コンテキストのベンチマークで OpenAI ada-002 および text-embedding-3-small を上回ることを示す。
- エンドツーエンドの再現性と監査可能性を可能にする透明な学習パイプラインとデータセットを提供する。
提案手法
- 8192 トークン対応を実現するためのアーキテクチャ変更(ロータリーポジショニング埋め込み、SwiGLU、Flash Attention)を用いた BERT-base アーキテクチャの適用。
- BooksCorpus および 2023 Wikipedia ダンプでMasked Language Modeling を用いて nomic-bert-2048 を学習。
- InfoNCE 損失とバッチ内ネガティブを用いた235Mの厳選テキスト対の無監督コントラスト学習を実施。
- 検索タスクのためのハードネガティブを用いた BEIR 互換データセットでの教師付きコントラスト学習を実施。
- タスクプレフィックス付きの最終的な教師ありコントラスト学習を、ネガティブの数を限定して行う。
実験結果
リサーチクエスチョン
- RQ1完全に監査可能でオープンデータの長文埋め込みモデルが、クローズドソースのベースラインと短文・長文タスクの両方で競争力がある、または上回ることができるか。
- RQ2長文コンテキスト(8192 トークン) embeddings を効果的に可能とする学習レジメンとアーキテクチャの選択は何か、学習性と再現性を維持しつつ。
- RQ3長文データの追加とマルチステージのコントラスト学習が、MTEB、LoCo、Jina long-context ベンチマークにどのような影響を与えるか。
- RQ4データローダーとキュレーションを公開することで、埋め込みモデルのエンドツーエンドの再現性と監査可能性が実現されるか。
主な発見
- Nomic-embed-text-v1 (137M パラメータ) は 8192 コンテキスト長で ada-002 および text-embedding-3-small を短文および長文コンテキストベンチマーク(MTEB、LoCo、Jina LC)で上回る。
- アブレート版 nomic-embed-text-v1-ablated は FEVER/HotpotQA/MEDI データを除去すると性能が低下することを示し、これらデータセットの影響を示唆する。
- 長文コンテキストベンチマーク(Jina LC および LoCo)は nomic-embed-text-v1 が jina-embeddings-v2-base-en をシーケンス長ごとに上回り、複数データセットで ada-002 を凌駕する。
- nomic-bert-2048 は GLUE 結果で競争力を示し、MosaicBERT に匹敵する基盤事前学習と長文適応を実証。
- 完全な学習スタック(ウェイト、コード、データ)は Apache 2.0 の下で公開され、エンドツーエンドの再現性と監査可能性を実現する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。