Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangled Modeling of Domain and Relevance for Adaptable Dense Retrieval

Jingtao Zhan, Qingyao Ai|arXiv (Cornell University)|2022. 08. 11.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 밀도 검색에서 도메인 특화 모델링과 관련성 평가를 분리하여 효과적이고 유연한 도메인 적응을 가능하게 하는 새로운 프레임워크인 분리된 밀도 검색(DDR)을 제안한다. 일회성으로 지도 학습 데이터를 사용해 도메인에 관계없이 관련성 평가 모듈(REM)을 학습하고, 각 타겟 도메인에 대해 비지도 학습 방식으로 도메인 적응 모듈(DAM)을 적응시킴으로써, 강력한 기준 모델 대비 외부 도메인 검색 성능을 크게 향상시킨다. 특히 자원이 부족하거나 미리보지 않은 도메인에서 두드러진 성능 향상을 보인다.

ABSTRACT

Recent advance in Dense Retrieval (DR) techniques has significantly improved the effectiveness of first-stage retrieval. Trained with large-scale supervised data, DR models can encode queries and documents into a low-dimensional dense space and conduct effective semantic matching. However, previous studies have shown that the effectiveness of DR models would drop by a large margin when the trained DR models are adopted in a target domain that is different from the domain of the labeled data. One of the possible reasons is that the DR model has never seen the target corpus and thus might be incapable of mitigating the difference between the training and target domains. In practice, unfortunately, training a DR model for each target domain to avoid domain shift is often a difficult task as it requires additional time, storage, and domain-specific data labeling, which are not always available. To address this problem, in this paper, we propose a novel DR framework named Disentangled Dense Retrieval (DDR) to support effective and flexible domain adaptation for DR models. DDR consists of a Relevance Estimation Module (REM) for modeling domain-invariant matching patterns and several Domain Adaption Modules (DAMs) for modeling domain-specific features of multiple target corpora. By making the REM and DAMs disentangled, DDR enables a flexible training paradigm in which REM is trained with supervision once and DAMs are trained with unsupervised data. Comprehensive experiments in different domains and languages show that DDR significantly improves ranking performance compared to strong DR baselines and substantially outperforms traditional retrieval methods in most scenarios.

연구 동기 및 목표

  • 도메인 이동으로 인해 외부 도메인 환경에서 성능 저하가 발생하는 밀도 검색(DR) 모델의 문제를 해결한다.
  • 기존 DR 모델이 관련성과 도메인 특화 특징을 동시에 학습하기 때문에 새로운 도메인에 대해 탄력적이지 못한 한계를 극복한다.
  • 각 타겟 도메인에서 레이블이 있는 데이터가 필요로 하지 않도록 효과적인 도메인 적응을 가능하게 하여 고비용 레이블링에 대한 의존도를 줄인다.
  • 도메인에 관계없이 관련성 패턴을 학습하는 것과 도메인 특화 특징을 분리함으로써 모듈화되고 확장 가능한 적응을 지원한다.
  • 높은 효과성을 유지하면서도 계산 및 파라미터 오버헤드를 최소화하는 학습 및 추론 프레임워크를 설계한다.

제안 방법

  • 두 구성 요소로 이루어진 분리된 아키텍처를 제안한다: 도메인에 관계없이 관련성 매칭을 위한 관련성 평가 모듈(REM)과 도메인 특화 특징을 위한 도메인 적응 모듈(DAMs).
  • 원천 도메인의 지도 학습 데이터를 사용해 일회성으로 REM을 학습하여 도메인 특화 특징과 독립적인 일반적인 관련성 패턴을 학습한다.
  • 레이블이 없는 데이터만을 사용해 각 DAM을 타겟 도메인 코퍼스에서 비지도 학습 방식으로 학습시켜 도메인 특화 적응을 수행한다.
  • REM이 학습 중에 도메인 특화 특징을 학습하지 않도록 하기 위해 분리된 미세조정(DF)을 구현함으로써 일반화 성능을 향상시킨다.
  • REM과의 호환성을 높이기 위해 타겟 도메인의 DAM을 랜덤 또는 BERT 체크포인트가 아닌 원천 도메인의 DAM 가중치로 초기화하는 순차적 초기화(SI)를 적용한다.
  • LoRA와 PA와 같은 파라미터 효율적 미세조정 방법을 사용해 DAM 적응 시 추가적인 파라미터와 추론 오버헤드를 최소화한다.

실험 결과

연구 질문

  • RQ1관련성 평가와 도메인 모델링을 분리함으로써 다양한 새로운 도메인에서 밀도 검색 모델의 일반화 성능이 향상되는가?
  • RQ2한 번만 학습된 REM이 재학습 없이도 여러 외부 도메인 환경에서 성능을 유지할 수 있는가?
  • RQ3타겟 도메인 코퍼스에서 DAM을 비지도 미세조정함으로써 도메인 이동 문제를 표준 DR 미세조정 대비 얼마나 효과적으로 완화할 수 있는가?
  • RQ4분리된 미세조정(DF), 순차적 초기화(SI)와 같은 최적화 기법 중에서 분리된 프레임워크의 안정성과 성능 향상에 가장 효과적인 것은 무엇인가?
  • RQ5LoRA와 PA와 같은 파라미터 효율적 미세조정 방법의 선택이 다양한 언어와 도메인에서 성능에 어떻게 영향을 미치는가?

주요 결과

  • DDR는 CPR-Medical(zh) 및 Lotte-Sci(en)와 같은 외부 도메인 데이터셋에서 강력한 DR 기준 모델 대비 R@1000에서 최대 12.6% 향상된 성능을 기록한다.
  • DDR는 대부분의 외부 도메인 환경에서 BM25와 같은 전통적 검색 방법보다 뛰어난 성능을 보이며, 자원이 부족하거나 새로운 도메인에서의 효과성을 입증한다.
  • 제거 실험 결과, 분리된 미세조정(DF)을 제거할 경우 REM의 일반화 능력이 저하되어 도메인 평균 5.5% 성능 하락이 발생한다.
  • 순차적 초기화(SI)는 DAM-REM 간 호환성을 향상시키며, DDR\SI는 DDR\DF 대비 R@1000에서 평균 2.5% 높은 성능을 기록한다.
  • LoRA와 PA는 파라미터 효율적 미세조정 방법으로서 추론 오버헤드가 극히 적으며, LoRA는 추가 계산이 전혀 없고, PA는 극히 소량의 비용만 추가한다.
  • 이 프레임워크는 강력한 다국어 일반화 성능를 보이며, PA는 중국어 데이터셋에서 LoRA를 능가하고, LoRA는 영어 데이터셋에서 PA를 능가함으로써 언어별 최적화 패tern이 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.