[논문 리뷰] Pre-trained Language Model for Web-scale Retrieval in Baidu Search
이 논문은 Baidu 검색을 위한 생산 환경에서 사용 가능한 검색 시스템을 제안하며, ERNIE 사전 학습된 언어 모델을 활용해 웹 스케일 검색에서 의미적 매칭을 향상시킨다. 트랜스포머 기반 양방향 인코더와 다단계 학습 파라다임, 통합된 배포 워크플로우를 적용하여, 특히 저빈도 및 자연어 질의에서 검색 효과성을 크게 향상시켰으며, 클릭률 및 체류 시간과 같은 온라인 사용자 참여 지표에서 뚜렷한 성과 향상을 보였다.
Retrieval is a crucial stage in web search that identifies a small set of query-relevant candidates from a billion-scale corpus. Discovering more semantically-related candidates in the retrieval stage is very promising to expose more high-quality results to the end users. However, it still remains non-trivial challenges of building and deploying effective retrieval models for semantic matching in real search engine. In this paper, we describe the retrieval system that we developed and deployed in Baidu Search. The system exploits the recent state-of-the-art Chinese pretrained language model, namely Enhanced Representation through kNowledge IntEgration (ERNIE), which facilitates the system with expressive semantic matching. In particular, we developed an ERNIE-based retrieval model, which is equipped with 1) expressive Transformer-based semantic encoders, and 2) a comprehensive multi-stage training paradigm. More importantly, we present a practical system workflow for deploying the model in web-scale retrieval. Eventually, the system is fully deployed into production, where rigorous offline and online experiments were conducted. The results show that the system can perform high-quality candidate retrieval, especially for those tail queries with uncommon demands. Overall, the new retrieval system facilitated by pretrained language model (i.e., ERNIE) can largely improve the usability and applicability of our search engine.
연구 동기 및 목표
- 기존의 키워드 기반 방법(예: BM25)이 어색한 표현이나 의미적으로 유사한 콘텐츠를 포착하지 못하는 대규모 웹 검색 환경에서 의미적 매칭 문제를 해결하기 위해.
- 학습 신호가 제한적인 낮은 빈도의 테일 질의를 모델링하기 어려운 문제를 개선하기 위해.
- 실제 고속도 웹 검색 엔진에서 사전 학습된 언어 모델(ERNIE)을 구현 가능한 실용적이고 확장 가능한 시스템 아키텍처를 설계하기 위해.
- 기존 텍스트 매칭 및 통계적 특징과 의미적 매칭을 통합하여 후보 문서의 관련성과 시스템의 강건성을 향상시키기 위해.
제안 방법
- 질의와 문서에 대해 별도의 인코더를 갖춘 ERNIE 기반 양방향 인코더를 사용하며, 트랜스포머의 깊은 자기주의 메커니즘을 활용해 세밀한 의미적 표현을 모델링한다.
- 다양한 데이터 소스와 목적을 활용한 다단계 학습 파라다임을 적용하여, 특히 희귀하거나 OOV(Out-of-Vocabulary) 질의에 대해 모델의 일반화 능력을 점진적으로 향상시킨다.
- 의미적 매칭과 기존의 BM25 검색을 결합하여 하이브리드 후보 생성 전략을 구현함으로써 재현율과 정밀도의 균형을 맞춘다.
- 초기 검색 후 상위 후보를 정제하기 위해 통계적 특징(예: 클릭률, 체류 시간 등)을 통합하는 경량의 후처리 필터링 모듈을 도입한다.
- 십억 규모의 웹 코퍼스에서 저지연 추론을 지원하는 확장 가능한 인프라를 갖춘 생산 환경에 시스템을 배포한다.
- 관련성 예측 성능 향상을 위해 다항 상호작용 기법과 데이터 마이닝 전략을 활용해 모델을 미세조정한다.

실험 결과
연구 질문
- RQ1ERNIE와 같은 사전 학습된 언어 모델이 기존의 키워드 기반 방법에 비해 웹 스케일 검색에서 의미적 매칭을 크게 향상시킬 수 있는가?
- RQ2다단계 학습이 저빈도 또는 테일 질의에 대해 검색 모델의 일반화 능력을 어떻게 향상시키는가?
- RQ3후처리 필터링 단계에서 의미적 특징과 통계적 특징을 통합할 경우 최종 결과 품질은 어느 정도 향상되는가?
- RQ4제안된 시스템 아키텍처는 실세계 웹 검색 엔진에서 PLM 기반 검색 모델을 효과적이고 효율적으로 배포할 수 있는가?
주요 결과
- 오프라인 평가에서 ERNIE 기반 검색 모델은 무작위 질의에서 NDCG(정규화된 누적 할인 수익)를 +0.17% 향상시키고, 테일 질의에서는 +0.22% 향상시켰다.
- 후처리 필터링 모듈은 무작위 질의에서 NDCG에 +0.10% 기여했고, 테일 질의에서는 +0.65% 기여하여 희귀 질의에 더 큰 영향을 미쳤다.
- 수동 평가에서 새로운 시스템은 무작위 질의에서 Good vs. Same vs. Bad(GSB) 점수를 3.50% 상승시켰고, 테일 질의에서는 7.50% 상승시켜 품질 향상이 뚜렷하게 나타났다.
- 온라인 A/B 테스트 결과, 총 클릭 수는 0.31% 증가했고, 클릭 후 머무름 행동은 0.57% 증가했으며, 평균 클릭 후 체류 시간은 0.62% 증가했으며, 모든 결과가 p < 0.05 수준에서 통계적으로 유의미했다.
- 장문의 자연어 질의에서 더 큰 향상이 나타났고, 이는 대화형 및 복잡한 질의를 더 잘 처리할 수 있음을 시사한다.
- ERNIE 기반 검색과 후처리 필터링의 조합은 모든 지표에서 통계적으로 유의미한 성과 향상을 이끌어내어 하이브리드 아키텍처의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.