Skip to main content
QUICK REVIEW

[논문 리뷰] Injecting Domain Adaptation with Learning-to-hash for Effective and Efficient Zero-shot Dense Retrieval

Nandan Thakur, Nils Reimers|arXiv (Cornell University)|2022. 05. 23.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 다양한 도메인 간에 효과적인 제로샷 밀도 검색을 향상시키기 위해 감독형 학습-해싱(LTH) 기법(BPR 및 JPQ)에 도메인 적응을 통합하는 것을 제안한다. GenQ 및 GPL과 같은 비지도 도메인 적응 기법을 활용하여 BEIR 기준으로 nDCG@10을 평균 11.5% 및 8.2% 향상시키며, 同시에 32배 메모리 효율성과 CPU 검색 지연 시간에서 14배/2배의 가속을 유지한다.

ABSTRACT

Dense retrieval overcome the lexical gap and has shown great success in ad-hoc information retrieval (IR). Despite their success, dense retrievers are expensive to serve across practical use cases. For use cases requiring to search from millions of documents, the dense index becomes bulky and requires high memory usage for storing the index. More recently, learning-to-hash (LTH) techniques, for e.g., BPR and JPQ, produce binary document vectors, thereby reducing the memory requirement to efficiently store the dense index. LTH techniques are supervised and finetune the retriever using a ranking loss. They outperform their counterparts, i.e., traditional out-of-the-box vector compression techniques such as PCA or PQ. A missing piece from prior work is that existing techniques have been evaluated only in-domain, i.e., on a single dataset such as MS MARCO. In our work, we evaluate LTH and vector compression techniques for improving the downstream zero-shot retrieval accuracy of the TAS-B dense retriever while maintaining efficiency at inference. Our results demonstrate that, unlike prior work, LTH strategies when applied naively can underperform the zero-shot TAS-B dense retriever on average by up to 14% nDCG@10 on the BEIR benchmark. To solve this limitation, in our work, we propose an easy yet effective solution of injecting domain adaptation with existing supervised LTH techniques. We experiment with two well-known unsupervised domain adaptation techniques: GenQ and GPL. Our domain adaptation injection technique can improve the downstream zero-shot retrieval effectiveness for both BPR and JPQ variants of the TAS-B model by on average 11.5% and 8.2% nDCG@10 while both maintaining 32$ imes$ memory efficiency and 14$ imes$ and 2$ imes$ speedup respectively in CPU retrieval latency on BEIR. All our code, models, and data are publicly available at https://github.com/thakur-nandan/income.

연구 동기 및 목표

  • 다양한 도메인에 적용될 때 기존 학습-해싱(LTH) 기법의 열악한 제로샷 일반화 성능을 해결한다.
  • 메모리나 추론 효율성을 희생시키지 않고 압축된 밀도 검색 모델의 후행 검색 성능을 향상시킨다.
  • 도메인 적응이 도메인 내 LTH와 제로샷 밀도 검색 간 성능 격차를 메울 수 있는지 평가한다.
  • BEIR의 18개 다채널 데이터셋 전반에서 일반화 능력을 향상시키면서도, 높은 효율성(메모리 사용량 및 검색 지연 시간 모두)을 유지한다.

제안 방법

  • 원천 도메인(MS MARCO)에서 생성된 합성 학습 데이터를 기반으로 사전 학습된 LTH 모델(BPR 및 JPQ)을 타겟 도메인(BEIR)에 맞게 미세조정하여 도메인 적응을 통합한다.
  • 두 가지 비지도 도메인 적응 기법인 GenQ 및 GPL을 사용하여 모델의 일반화 능력을 향상시키기 위해 합성 쿼리-문서 쌍을 생성한다.
  • 합성 데이터 기반으로 순서 매기기 손실(BPR 손실 등)을 사용해 LTH 모델을 훈련시켜, 교차 도메인 의미 정렬을 학습하도록 한다.
  • TAS-B 검색 모델의 원래 32비트 밀도 임베딩 크기를 유지하고, LTH를 통해 이진 코드로 압축하여 검색 효율성을 유지한다.
  • BEIR 벤치마크에서 18개의 다양한 데이터셋 전반에 걸쳐 nDCG@10을 주요 평가 지표로 사용하여 평가한다.
  • FAISS 및 브루트 포스 검색을 사용해 메모리 사용량과 CPU 검색 지연 시간을 측정하여 효율성이 유지됨을 확인한다.

실험 결과

연구 질문

  • RQ1BPR 및 JPQ와 같은 감독형 LTH 기법이 BEIR 벤치마크의 다양한 도메인과 같은 도메인 간 제로샷 검색에 효과적으로 일반화될 수 있는가?
  • RQ2단일 도메인에서의 난이도 없는 LTH 미세조정 대비, LTH 모델에 도메인 적응을 통합하면 제로샷 검색 성능이 향상되는가?
  • RQ3도메인 적응이 LTH의 메모리 및 지연 시간 효율성을 유지하면서도 교차 도메인 성능 향상에 얼마나 기여하는가?
  • RQ4다른 도메인 적응 전략(GenQ 대비 GPL)은 미지의 도메인에서 LTH 성능 향상에 어떻게 다른 영향을 미치는가?

주요 결과

  • LTH 기법(BPR 및 JPQ)을 제로샷 검색에 직접 적용할 경우, BEIR 데이터셋 평균 기준으로 제로샷 TAS-B 밀도 검색 모델 대비 nDCG@10에서 최대 14% 성능이 열등하다.
  • GPL 기반 도메인 적응을 통한 통합으로 BPR 및 JPQ의 성능이 각각 평균 11.5% 및 8.2% 향상되었으며, 제로샷 TAS-B 기준으로 nDCG@10에서 성능 향상을 달성했다.
  • 제안된 방법은 원래 TAS-B 밀도 검색 모델 대비 32배 메모리 효율성을 유지하며, 880만 개의 문장에 대해 인덱스 크기가 1GB 이하로 유지된다.
  • CPU 검색 지연 시간은 BPR 기준 14배, JPQ 기준 2배 가속화되어 빠른 검색 성능을 입증했다.
  • GPL 기반 도메인 적응은 가장 높은 성능 향상을 이끌었지만, 교차 인코더 교사 추론 및 전체 코퍼스 임베딩 계산으로 인해 계산 비용이 높다.
  • 이 방법은 모델에 종속적이지 않으며, Contriever나 RepCONC와 같은 더 강력한 백본 모델이나 최신 LTH 기법으로도 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.