[논문 리뷰] Nomic Embed: Training a Reproducible Long Context Text Embedder
이 기술 보고서는 nomic-embed-text-v1을 제시합니다. 이는 OpenAI ada-002 및 text-embedding-3-small을 짧은 맥락과 긴 맥락 벤치마크에서 능가하는 8192-token 길이의 컨텍스트 텍스트 임베딩 모델이며, 완전히 감사 가능(train data, code, weights 포함)한 데이터와 가중치, 코드까지 공개된 오픈 소스 버전입니다.
This technical report describes the training of nomic-embed-text-v1, the first fully reproducible, open-source, open-weights, open-data, 8192 context length English text embedding model that outperforms both OpenAI Ada-002 and OpenAI text-embedding-3-small on the short-context MTEB benchmark and the long context LoCo benchmark. We release the training code and model weights under an Apache 2.0 license. In contrast with other open-source models, we release the full curated training data and code that allows for full replication of nomic-embed-text-v1. You can find code and data to replicate the model at https://github.com/nomic-ai/contrastors.
연구 동기 및 목표
- 완전한 재현 가능한 장문 컨텍스트 텍스트 임베딩 모델을 감사 가능 데이터, 가중치, 코드와 함께 демонstr레이션합니다.
- nomic-embed-text-v1이 짧은 맥락 및 긴 맥락 벤치마크에서 OpenAI ada-002 및 text-embedding-3-small보다 우수하다는 것을 보여줍니다.
- 끝에서 끝까지 재현 가능성과 감사 가능성을 가능하게 하는 투명한 훈련 파이프라인과 데이터셋을 제공합니다.
제안 방법
- 8192 토큰 지원을 위한 BERT-base 아키텍처를 회전 포지셔널 임베딩(rotary positional embeddings), SwiGLU, Flash Attention 등의 아키텍처 변경으로 적용합니다.
- BooksCorpus와 2023 Wikipedia 덤프에서 masked language modeling으로 nomic-bert-2048를 훈련합니다.
- InfoNCE 손실과 배치 내 음수를 사용한 235M 조달 텍스트 쌍에 대한 비지도 대조(pretraining)를 수행합니다.
- 회수 작업에서 Hard negative를 사용한 BEIR 호환 데이터셋에서 지도 대조 학습으로 미세조정합니다.
- 태스크 접두사와 제한된 수의 음수를 사용한 최종 지도 대조 미세조정으로 마무리합니다.
실험 결과
연구 질문
- RQ1완전한 감사 가능 오픈 데이터 장문 임베딩 모델이 비공개 기반선 대비 단기 및 장기 작업에서 경쟁적이거나 우수한 성능을 달성할 수 있는가?
- RQ2어떤 훈련 regimen과 아키텍처 선택이 8192-token의 효과적인 장문 컨텍스트 임베딩을 가능하게 하면서 학습 가능성과 재현성을 유지하는가?
- RQ3장문 컨텍스트 데이터와 다단계 대조 학습을 추가하는 것이 MTEB, LoCo, Jina 장문 벤치마크에 어떤 영향을 미치는가?
- RQ4데이터 로더와 큐레이션을 공개하는 것이 임베딩 모델의 끝에서 끝까지 재현성과 감사 가능성을 가능하게 하는가?
주요 결과
- nomic-embed-text-v1 (137M 매개변수) 은 8192 컨텍스트 길이로 단기 및 장기 벤치마크(MTEB, LoCo, Jina LC)에서 ada-002 및 text-embedding-3-small보다 우수합니다.
- FEVER/HotpotQA/MEDI 데이터를 제거하면 성능이 떨어지는 ablated 버전 nomic-embed-text-v1-ablated가 나타나 이 데이터 세트의 영향이 있음을 시사합니다.
- 장문 컨텍스트 벤치마크(Jina LC 및 LoCo)에서 nomic-embed-text-v1은 시퀀스 길이에 따라 jina-embeddings-v2-base-en을 능가하고 여러 데이터셋에서 ada-002를 능가합니다.
- nomic-bert-2048은 매력적인 GLUE 결과를 달성하며 MosaicBERT와 유사한 성능을 보여 장문 컨텍스트 적응과 강력한 기본 사전 학습을 입증합니다.
- 전체 훈련 스택(가중치, 코드, 데이터)이 Apache 2.0 라이선스로 공개되어 끝에서 끝까지 재현과 감사 가능성을 가능하게 합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.