Skip to main content
QUICK REVIEW

[논문 리뷰] One Embedder, Any Task: Instruction-Finetuned Text Embeddings

Hongjin Su, Weijia Shi|arXiv (Cornell University)|2022. 12. 19.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 자연어 지시문을 조건으로 하여 태스크 및 도메인 인식 표현을 생성하는 단일 텍스트 임bedder인 InstructOR를 소개한다. 대상 태스크에 대한 인간이 작성한 지시문을 사용하여 330개의 다양한 데이터셋에서 대조 학습을 통해 훈련된 InstructOR는 70개의 태스크에 걸쳐 최신 기술 수준의 성능을 달성한다—훈련 중에 볼 수 없었던 66개의 태스크를 포함하여 평균 3.4% 향상된 성능을 보이며, 파rameter 수는 335M에 불과하다.

ABSTRACT

We introduce INSTRUCTOR, a new method for computing text embeddings given task instructions: every text input is embedded together with instructions explaining the use case (e.g., task and domain descriptions). Unlike encoders from prior work that are more specialized, INSTRUCTOR is a single embedder that can generate text embeddings tailored to different downstream tasks and domains, without any further training. We first annotate instructions for 330 diverse tasks and train INSTRUCTOR on this multitask mixture with a contrastive loss. We evaluate INSTRUCTOR on 70 embedding evaluation tasks (66 of which are unseen during training), ranging from classification and information retrieval to semantic textual similarity and text generation evaluation. INSTRUCTOR, while having an order of magnitude fewer parameters than the previous best model, achieves state-of-the-art performance, with an average improvement of 3.4% compared to the previous best results on the 70 diverse datasets. Our analysis suggests that INSTRUCTOR is robust to changes in instructions, and that instruction finetuning mitigates the challenge of training a single model on diverse datasets. Our model, code, and data are available at https://instructor-embedding.github.io.

연구 동기 및 목표

  • 기존 텍스트 임베딩 모델이 새로운 태스크와 도메인에서의 제로샷 일반화 성능이 열 劣한 문제를 해결하기 위해.
  • 태스크 및 도메인 지시문이 추가 편집 없이 효과적이고 맞춤형 임베딩을 생성할 수 있는 단일 모델을 가능하게 할 수 있는지 탐색하기 위해.
  • 다양한 태스크에 잘 작동하는 통합된 지시 미세조정 임베딩 모델을 개발하기 위해.
  • 지시 기반 미세조정이 이질적인 데이터셋에서의 강인성과 성능 향상에 기여하는지 증명하기 위해.

제안 방법

  • InstructOR는 입력 텍스트와 태스크 또는 도메인을 설명하는 자연어 지시문을 모두 인코딩하여 태스크 인식 임베딩을 생성한다.
  • 모델은 대조 손실을 사용하여 의미적으로 관련된 쌍 간의 유사도를 극대화하기 위해 330개의 다양한 텍스트 임베딩 데이터셋으로 구성된 다중태스크 혼합 데이터셋에서 훈련된다.
  • MEDI 데이터셋은 각 입력 쌍에 대해 인간이 작성한 태스크 및 도메인 기술을 포함하며, 330개의 지시가 담긴 데이터셋으로 구성되어 있다.
  • 시아미즈 네트워크 아키텍처를 사용하여 텍스트-지시어 쌍의 임베딩을 계산하고, 대조 손실을 통해 의미 유사도를 최적화한다.
  • 모델은 분류, 검색, 클러스터링, 의미 유사도 태스크를 포함한 70개의 태스크에 대한 후행 임베딩 벤치마크에서 평가된다.
  • GTR 및 SimCSE와 같은 이전 최신 기술 수준의 모델들과 성능을 비교하며, 지시 미세조정의 기여도를 분리하기 위한 추상화 연구를 수행한다.

실험 결과

연구 질문

  • RQ1단일 텍스트 임베딩 모델이 자연어 지시문만을 사용하여 높은 품질의 태스크 특화 표현을 생성할 수 있는가?
  • RQ2지시 기반 미세조정이 다양한 후행 태스크 및 도메인에서 제로샷 일반화 성능을 향상시키는가?
  • RQ3지시 기반 미세조정은 동일한 태스크 설명의 다양한 표현 또는 약간 다른 표현에 대해 강인성에 영향을 주는가?
  • RQ4지시 감독을 통해 훈련된 작은 모델(335M 파라미터)이 더 큰 모델(1.5B 파라미터)을 능가할 수 있는가?
  • RQ5지시 미세조정이 이질적인 데이터셋 간의 분포 이탈 문제를 어느 정도 완화하는가?

주요 결과

  • InstructOR는 70개의 다양한 후행 임베딩 태스크에서 이전 최신 기술 수준의 성능보다 평균 3.4% 향상되었으며, 이 중 66개는 훈련 중에 볼 수 없었던 태스크였다.
  • 335M 파라미터에 불과함에도 불구하고, InstructOR는 70개 평가 태스크 중 63개에서 더 큰 1.5B 파라미터 GTR 모델을 능가했다.
  • InstructOR는 약간 다른 표현 방식의 지시어에도 불구하고 안정적인 성능을 보이며, 파라프라제이션에 강인함을 입증했다.
  • 추상화 연구를 통해 지시 미세조정이 필수적임을 확인했다—지시 없이 훈련할 경우 성능이 크게 열 劣했다.
  • InstructOR는 MTEB 벤치마크의 모든 카테고리에서 최신 기술 수준의 성능을 달성했으며, 검색, 분류, 클러스터링, 의미 텍스트 유사도를 포함한다.
  • 의료 및 금융과 같은 자원이 적은 도메인에서도 특히 뛰어난 제로샷 전이 능력을 보이며 뛰어난 성능을 발휘했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.