[논문 리뷰] A Bi-Step Grounding Paradigm for Large Language Models in Recommendation Systems
이 논문은 지침 테이닝을 통해 대규모 언어 모델(Large Language Models, LLMs)을 추천 공간에 이원적 기반화하는 BIGRec를 제안한다. 첫 번째 단계에서는 LLM을 지시 테이닝을 통해 의미 있는 아이템 설명을 생성하도록 훈련시키고, 두 번째 단계에서는 인기도 및 공동 필터링과 같은 통계적 신호를 활용해 이러한 설명을 실제 아이템으로 매핑한다. 이 방법은 소수의 few-shot 훈련으로도 최신 기술 수준의 성능을 달성하며, 전체 데이터에 기반한 지도 학습 모델을 능가하며, LLM이 주입된 통계적 사전 지식에서 크게 유의미한 이점을 얻음을 보여준다.
As the focus on Large Language Models (LLMs) in the field of recommendation intensifies, the optimization of LLMs for recommendation purposes (referred to as LLM4Rec) assumes a crucial role in augmenting their effectiveness in providing recommendations. However, existing approaches for LLM4Rec often assess performance using restricted sets of candidates, which may not accurately reflect the models' overall ranking capabilities. In this paper, our objective is to investigate the comprehensive ranking capacity of LLMs and propose a two-step grounding framework known as BIGRec (Bi-step Grounding Paradigm for Recommendation). It initially grounds LLMs to the recommendation space by fine-tuning them to generate meaningful tokens for items and subsequently identifies appropriate actual items that correspond to the generated tokens. By conducting extensive experiments on two datasets, we substantiate the superior performance, capacity for handling few-shot scenarios, and versatility across multiple domains exhibited by BIGRec. Furthermore, we observe that the marginal benefits derived from increasing the quantity of training samples are modest for BIGRec, implying that LLMs possess the limited capability to assimilate statistical information, such as popularity and collaborative filtering, due to their robust semantic priors. These findings also underline the efficacy of integrating diverse statistical information into the LLM4Rec framework, thereby pointing towards a potential avenue for future research. Our code and data are available at https://github.com/SAI990323/Grounding4Rec.
연구 동기 및 목표
- 제한된 후보 샘플링을 넘어서 LLM의 종합적 순위 매기기 능력을 추천 시스템에서 조사하기 위해.
- 기존의 LLM4Rec 방법들이 소규모 후보 집합에서만 평가되어 진정한 전역 순위 성능를 반영하지 못하는 격차를 해결하기 위해.
- LLM이 의미적으로 유의미한 아이템 토큰을 생성하고 실제 세계의 아이템으로 기반화할 수 있도록 하는 이단계 기반 프레임워크를 개발하기 위해.
- 인기도 및 공동 필터링과 같은 통계 정보가 LLM 기반 추천에 효과적으로 통합되어 정확도가 향상되는지 탐색하기 위해.
- LLM이 제한된 데이터에서 효과적으로 학습할 수 있는지, 그리고 강력한 의미적 사전 지식으로 인해 더 많은 데이터로의 여유로운 성능 향상이 제한되는지 평가하기 위해.
제안 방법
- 첫 번째 단계에서는 사용자 선호도 데이터를 기반으로 지시 테이닝을 통해 LLM을 실제 및 가상의 아이템에 대한 기술적 토큰 시퀀스 생성하도록 훈련시킨다.
- 두 번째 단계에서는 생성된 토큰 시퀀스와 사전 훈련된 디코더 모델의 아이템 임베딩 간의 의미적 유사도를 계산하여 실제 아이템으로 매핑한다.
- 인기도 및 공동 필터링과 같은 통계 정보는 식 (3)에 정의된 가중 유사도 점수 함수를 통해 두 번째 단계에 주입된다.
- 이 프레임워크는 최소한의 레이블 데이터로 LLM을 추천 공간에 기반화함으로써 소수의 학습을 지원하며, 제한된 감독 하에서도 효과적인 생성을 가능하게 한다.
- 이 방법은 LLM4Rec 파ip라인에 다양한 통계적 특징을 탄력적으로 통합할 수 있게 하여 LLM의 핵심 아키텍처를 변경하지 않고도 추천의 관련성을 향상시킨다.
- 추론 중에는 비트 서치 전략을 사용하여 다양한 후보 아이템 설명을 생성하고, 아이템 임베딩 공간에서 가장 유사한 실제 아이템을 검색한다.
실험 결과
연구 질문
- RQ1지시 테이닝을 통해 추천 공간에 기반화된 LLM이 소수의 후보 집합을 넘어서 전역 순위 성능을 달성할 수 있는가?
- RQ2훈련 데이터 크기가 증가함에 따라 LLM 기반 추천의 성능은 어떻게 변화하며, 강력한 의미적 사전 지식으로 인해 여유로운 성능 향상이 제한되는가?
- RQ3인기도 및 공동 필터링과 같은 통계 신호가 LLM이 생성한 아이템 설명을 실제 아이템으로 기반화하는 데 얼마나 기여하는가?
- RQ4통계 정보를 LLM4Rec 파이프라인에 통합할 경우, 전통적 모델에 비해 LLM에서 더 큰 성능 향상을 얻을 수 있는가?
- RQ5이원적 기반화 프레임워크는 의미적 생성과 실제 세계의 아이템 검색을 효율적이고 확장 가능한 방식으로 효과적으로 균형을 맞출 수 있는가?
주요 결과
- BIGRec는 단지 1,024개의 샘플로 훈련되었음에도 불구하고, 전체 데이터셋으로 훈련된 전통적 모델인 SASRec, Caser, DROS보다 대부분의 지표에서 뛰어난 성능을 보이며, 특히 더 큰 K 값에서 NDCG@K 및 Recall@K 지표에서 뚜렷한 우월성을 보였다.
- BIGRec에 인기도 정보를 통합하면 성능 향상이 일관되게 이루어지며, 특히 더 높은 K 값에서 인기도만을 추천 신호로 사용하는 것보다 뚜렷하게 뛰어난 성능을 보였다.
- 기반화 메커니즘을 통해 공동 필터링 신호를 추가하면 기존 모델보다 BIGRec에서 더 큰 성능 향상을 얻었으며, 이는 LLM이 의미 정보에 더 의존하고 따라서 보완적인 통계적 특징에서 더 큰 이점을 얻음을 시사한다.
- BIGRec의 훈련 데이터 크기 증가에 따른 여유로운 성능 향상은 제한적이며, 이는 추론 중 LLM이 인기도나 공동 필터링과 같은 통계 패턴보다 의미적 사전 지식을 우선시함을 시사한다.
- 이원적 기반화 프레임워크는 의미적 생성과 실제 아이템 검색을 효과적으로 분리함으로써 통계적 신호의 통합을 가능하게 하면서도 LLM의 생성 능력을 유지한다.
- 이 프레임워크는 강력한 소수의 학습 일반화 성능을 보이며, 최소한의 미세조정 데이터로도 높은 성능을 유지함으로써 효율성과 확장성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.