[논문 리뷰] Ask Me What You Need: Product Retrieval using Knowledge from GPT-3
이 논문은 키워드가 명시되지 않은 의도 기반 쿼리—예를 들어 '어머니의 날에 엄마께 뭐 드릴 만한 게 있을까?'—에 답하기 위해 GPT-3의 내부 지식 기반을 p-tuning을 통해 활용하는 GPT-3 기반 제품 검색 시스템을 제안한다. GPT-3가 직접 제품 카테고리를 예측하도록 프롬프트를 설정함으로써, 외부 키워드 없이도 상태최저 성능을 달성한다. 특히 냉시작 시나리오에서 빛을 발하며, 실제 데이터셋에서 BERT와 BM25보다 최대 15.1% 높은 HR@300 성능을 기록한다.
As online merchandise become more common, many studies focus on embedding-based methods where queries and products are represented in the semantic space. These methods alleviate the problem of vocab mismatch between the language of queries and products. However, past studies usually dealt with queries that precisely describe the product, and there still exists the need to answer imprecise queries that may require common sense knowledge, i.e., 'what should I get my mom for Mother's Day.' In this paper, we propose a GPT-3 based product retrieval system that leverages the knowledge-base (KB) of GPT-3 for question answering; users do not need to know the specific illustrative keywords for a product when querying. Our method tunes prompt tokens of GPT-3 to prompt knowledge and render answers that are mapped directly to products without further processing. Our method shows consistent performance improvement on two real-world and one public dataset, compared to the baseline methods. We provide an in-depth discussion on leveraging GPT-3 knowledge into a question answering based retrieval system.
연구 동기 및 목표
- 정확한 키워드 없이도 모호한 의도 기반 쿼리에 적절한 제품을 검색하는 데 도전하는 것.
- 외부 지식 기반 없이 GPT-3의 내부 지식 기반을 암묵적인 지식 소스로 활용하여 제품 검색에 활용하는 것.
- 학습 중에 볼 수 없었던 제품 또는 쿼리 의미를 가진 냉시작 쿼리에서 성능을 향상시키는 것.
- p-tuning과 파인튜닝, 모델 크기 확장을 비교하여 검색 작업에서의 효과를 평가하는 것.
제안 방법
- 검색 모델은 [PROMPT 1:d] [query] [MASK]와 같은 프롬프트 템플릿을 사용하며, 학습 가능한 연속적 프롬프트 토큰을 p-tuning을 통해 최적화한다.
- 모델은 토큰 수준의 로그리듬에 가중치를 부여한 합산을 통해 가장 가능성 높은 제품 카테고리를 예측한다: $ s_i = Σ_j \alpha_j \mathcal{M}(t_j|\tilde{q}) $.
- 학습 중에는 GPT-3의 사전 학습된 파라미터를 유지하면서 프롬프트 임베딩만 업데이트한다.
- 카테고리 점수 기반으로 상위-K 카테고리를 선별하고, 카테고리-제품 매핑 테이블을 통해 후보 제품으로 매핑한다.
- 최종 순위 매기기는 별도의 랭킹 모델을 사용해 후보 제품을 점수 매기고 재정렬한다.
- 모델 파라미터의 파손적 기억 상실을 방지하기 위해 GPT-3의 파인튜닝을 피하고, 지식 접근을 위해 프롬프트 튜닝에 의존한다.
실험 결과
연구 질문
- RQ1외부 지식 기반 없이 GPT-3의 내부 지식을 효과적으로 제품 검색에 활용할 수 있는가?
- RQ2GPT-3를 검색 작업에 적응시키는 데 있어 p-tuning과 파인튜닝의 성능 차이는 어떻게 되는가?
- RQ3GPT-3의 모델 크기를 늘리면 의도 기반 쿼리 검색 성능에 뚜렷한 향상이 이루어지는가?
- RQ4학습 중에 볼 수 없었던 냉시작 쿼리에 대해 시스템이 일반화 가능한가?
- RQ5표준 및 분포 외 설정 모두에서 이 방법은 BERT와 BM25보다 어떻게 성능을 냈는가?
주요 결과
- 제안된 방법은 Gift 데이터셋에서 HR@300이 15.14%를 기록했으며, BERT 기반 검색보다 15.0% 향상되었고, 다음으로 우수한 베이스라인보다 15.1% 향상되었다.
- 13B GPT-3 모델은 더 작은 모델들보다 크게 뛰어나며, HR@300가 1.3B 모델의 0.0628에서 13B 모델의 0.1514로 증가했다.
- p-tuning은 제로샷 및 파인튜닝된 GPT-3보다 뚜렷이 뛰어나며, 137M p-tuned 모델이 1.3B 파인튜닝 모델보다 성능이 뛰어났다.
- 냉시작 테스트 세트에서 시스템은 HR@300가 0.0262를 기록했으며, BERT 기반 검색(0.0141)보다 85.8% 향상되었다.
- 공개 QA 데이터셋에 대해서도 일반화 능력을 입증했으며, Google LLC 데이터셋에서 BM25와 BERT를 모두 앞섰다.
- 제거 실험을 통해 p-tuning이 파인튜닝보다 파괴적 기억 상실을 방지하고 GPT-3의 사전 학습된 지식을 더 잘 유지함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.