Skip to main content
QUICK REVIEW

[논문 리뷰] No Parameter Left Behind: How Distillation and Model Size Affect Zero-Shot Retrieval

Guilherme Moraes Rosa, Luiz Bonifacio|arXiv (Cornell University)|2022. 06. 06.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 모델 크기와 지식 정제가 제로샷 검색 성능에 미치는 영향을 조사하며, 도메인 외부 설정에서 더 큰, 정제되지 않은 재순서 모델이 정제된 모델과 밀도 높은 모델보다 유의미하게 뛰어난 성능을 보임을 입증한다. 주요 발견은 모델 파rameter 수를 늘릴수록 일반화 능력이 향상되며, 3B 파라미터를 가진 monoT5-3B 재순서 모델이 BEIR 데이터셋 18개 중 12개에서 최신 기준 성능을 달성하여 정제된 모델과 더 큰 밀도 높은 재검색 모델을 모두 앞선다.

ABSTRACT

Recent work has shown that small distilled language models are strong competitors to models that are orders of magnitude larger and slower in a wide range of information retrieval tasks. This has made distilled and dense models, due to latency constraints, the go-to choice for deployment in real-world retrieval applications. In this work, we question this practice by showing that the number of parameters and early query-document interaction play a significant role in the generalization ability of retrieval models. Our experiments show that increasing model size results in marginal gains on in-domain test sets, but much larger gains in new domains never seen during fine-tuning. Furthermore, we show that rerankers largely outperform dense ones of similar size in several tasks. Our largest reranker reaches the state of the art in 12 of the 18 datasets of the Benchmark-IR (BEIR) and surpasses the previous state of the art by 3 average points. Finally, we confirm that in-domain effectiveness is not a good indicator of zero-shot effectiveness. Code is available at https://github.com/guilhermemr04/scaling-zero-shot-retrieval.git

연구 동기 및 목표

  • 신경 검색 모델에서 도메인 내 성능이 제로샷 성능을 신뢰성 있게 예측할 수 있는가를 평가하기 위해.
  • 다양한 도메인 간 제로샷 일반화에서 모델 크기와 지식 정제의 역할을 조사하기 위해.
  • 다양한 계산 자원 제약 조건 하에서 재순서 모델과 밀도 높은 검색 모델의 성능을 비교하기 위해.
  • 배포 시 미리 보지 않은 도메인에서 정제된 모델이 강력한 성능을 유지할 수 있는가를 판단하기 위해.

제안 방법

  • MS MARCO 데이터셋에서 도메인 내 평가를 위해 미세조정된 정제된 모델(예: MiniLM)과 더 큰 정제되지 않은 재순서 모델(예: monoT5-3B)을 사용하였다.
  • BEIR 벤치마크의 18개 다양한 데이터셋(의료, 금융, 웹 도메인 포함)에서 모든 모델을 제로샷으로 평가하였다.
  • 이중 단계 검색 파이프라인을 사용: BM25가 1000개의 후보를 추출한 후, 신경 모델이 이를 재순서하였다.
  • nDCG@10를 사용해 성능을 비교하고, A100 GPU에서 쿼리당 추론 지연 시간을 측정하여 효율성 평가를 수행하였다.
  • 재순서 모델과 밀도 높은 검색 모델 모두 동일한 백본 아키텍처(예: T5)를 사용해 훈련 및 평가함으로써 아키텍처와 크기의 영향을 고립시켰다.
  • 재순서 모델에서의 조기 쿼리-문서 상호작용과 밀도 높은 모델의 고정된 벡터 유사도 간 영향을 분석하였다.

실험 결과

연구 질문

  • RQ1MS MARCO에서의 도메인 내 성능이 도메인 외부 데이터셋에서의 제로샷 성능을 신뢰성 있게 예측할 수 있는가?
  • RQ2모델 크기를 늘릴수록 정제된 모델과 비교해 신경 재순서 모델의 제로샷 일반화 능력은 어떻게 영향을 받는가?
  • RQ3더 많은 파라미터를 가진 재순서 모델이 제로샷 설정에서 유사한 크기의 밀도 높은 검색 모델보다 일관되게 뛰어난 성능을 보이는가?
  • RQ4지식 정제와 모델 크기 중에서 제로샷 검색 성능에 미치는 상대적 영향은 무엇인가?
  • RQ5왜 밀도 높은 검색 모델은 재순서 모델과 비교해 새로운 도메인으로의 일반화 능력이 떨어지는가?

주요 결과

  • 3B 파라미터를 가진 monoT5-3B 재순서 모델이 BEIR 데이터셋 18개 중 12개에서 최신 기준 성능을 달성하였으며, 이는 이전 최고 기록보다 평균 3점 이상 높은 성능을 기록하였다.
  • FiQA 금융 데이터셋에서, monoT5-3B는 MiniLM보다 nDCG@10 기준 약 16점 높은 성능을 기록하였으며, 이는 MiniLM가 100배 더 작음에도 불구하고 성능이 열등하다는 것을 의미한다.
  • MiniLM가 MS MARCO에서 매우 큰 모델(monoT5-3B)과 유사한 성능을 보였음에도 불구하고, 제로샷 데이터셋에서는 유의미하게 떨어지는 성능을 보였다.
  • 가장 큰 재순서 모델(monoT5-3B)은 BEIR에서 nDCG@10 0.5321을 기록하여 더 큰 밀도 높은 검색 모델인 GTR(5.8B 파라미터)와 ColBERTv2를 모두 앞섰다.
  • 더 높은 파라미터 수에도 불구하고, monoT5-3B는 MiniLM(0.64s/query)와 비교해 근사한 경쟁 능력을 보이는 지연 시간(14.63s/query)을 기록하여, 큰 모델이 실제로 효율적일 수 있음을 보여주었다.
  • 본 연구는 밀도 높은 검색 모델이 고정된 768차원 벡터로 인해 크기가 커져도 성능이 포화 상태에 이르게 되며, 반면 재순서 모델은 계속해서 성능 향상을 이어간다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.