[논문 리뷰] RecRanker: Instruction Tuning Large Language Model as Ranker for Top-k Recommendation
RecRanker는 상위-k 추천을 위한 지시 미세조정된 대규모 언어 모델(LM) 프레임워크를 소개하며, 적응형 사용자 샘플링, 위치 이동 프롬프트 설계, 기존 추천 모델의 신호 통합을 통해 성능을 향상시킵니다. 포인트와이즈, 페air와이즈, 리스트와이즈 순위 매기기 작업을 융합한 하이브리드 순위 매기기 전략을 통해 RecRanker는 GPT-3.5-turbo와 표준 LLM을 모두 능가하며, 실제 데이터셋에서 히트 및 nDCG 지표에서 뚜렷한 향상을 보이며 최신 기술 수준(SOTA) 성능을 달성합니다.
Large Language Models (LLMs) have demonstrated remarkable capabilities and have been extensively deployed across various domains, including recommender systems. Prior research has employed specialized extit{prompts} to leverage the in-context learning capabilities of LLMs for recommendation purposes. More recent studies have utilized instruction tuning techniques to align LLMs with human preferences, promising more effective recommendations. However, existing methods suffer from several limitations. The full potential of LLMs is not fully elicited due to low-quality tuning data and the overlooked integration of conventional recommender signals. Furthermore, LLMs may generate inconsistent responses for different ranking tasks in the recommendation, potentially leading to unreliable results. In this paper, we introduce extbf{RecRanker}, tailored for instruction tuning LLMs to serve as the extbf{Ranker} for top- extit{k} extbf{Rec}ommendations. Specifically, we introduce an adaptive sampling module for sampling high-quality, representative, and diverse training data. To enhance the prompt, we introduce a position shifting strategy to mitigate position bias and augment the prompt with auxiliary information from conventional recommendation models, thereby enriching the contextual understanding of the LLM. Subsequently, we utilize the sampled data to assemble an instruction-tuning dataset with the augmented prompts comprising three distinct ranking tasks: pointwise, pairwise, and listwise rankings. We further propose a hybrid ranking method to enhance the model performance by ensembling these ranking tasks. Our empirical evaluations demonstrate the effectiveness of our proposed RecRanker in both direct and sequential recommendation scenarios.
연구 동기 및 목표
- 기존의 LLM 기반 순위 매기기 모델이 단일 순위 매기기 작업에 집중하고 전통적인 추천 모델의 신호를 忽시하는 데서 발생하는 격차를 해결하기 위해.
- 중요도 인식 및 클러스터링 기반 사용자 샘플링 전략을 도입하여 훈련 데이터의 품질과 다양성을 향상시키기 위해.
- 지시 미세조정 과정에서 위치 이동 전략을 적용하여 LLM 프롬프트의 위치 편향을 완화하기 위해.
- 협업 필터링 모델에서 유도된 보조 신호를 자연어 프롬프트에 통합하여 LLM의 추론 능력을 향상시키기 위해.
- 포인트와이즈, 페어와이즈, 리스트와이즈 순위 매기기 헤드를 융합한 하이브리드 순위 매기기 방법을 개발하여 추천 성능을 향상시키기 위해.
제안 방법
- 적응형 사용자 샘플링은 데이터 품질과 다양성을 확보하기 위해 고상호작용 및 대표성 있는 사용자를 선별합니다.
- 추론 과정에서 위치 편향을 줄이기 위해 프롬프트에 위치 이동 전략을 적용하여 순위 결과의 공정성을 향상시킵니다.
- 기존 추천 모델(MF, LightGCN 등)의 보조 신호를 자연어 기술로 표현하여 프롬프트에 통합함으로써 맥락을 풍부화시킵니다.
- 세 가지 다른 순위 매기기 작업(포인트와이즈, 페어와이즈, 리스트와이즈)을 포함한 지시 미세조정 데이터셋을 구성하며, 각 작업에 대해 확장된 프롬프트를 제공합니다.
- 하이브리드 순위 매기기 방법은 가중치 통합을 통해 세 가지 순위 매기기 헤드의 예측을 융합하여 종합적인 추천 정확도를 향상시킵니다.
- LLaMA-2 모델은 데이터셋 크기에 비례하여 조정된 초모수를 사용하여 정제된 데이터셋으로 미세조정됩니다.
실험 결과
연구 질문
- RQ1포인트와이즈, 페어와이즈, 리스트와이즈 순위 매기기 작업을 하나의 지시 미세조정된 LLM에 통합하면 상위-k 추천 성능이 향상되는가?
- RQ2기존 추천 모델의 보조 신호 통합이 LLM 기반 순위 매기기 품질에 어떤 영향을 미치는가?
- RQ3적응형 사용자 샘플링 전략이 냉시작 또는 상호작용이 적은 사용자에 대한 모델 일반화 및 성능 향상에 얼마나 기여하는가?
- RQ4지시 미세조정 과정에서 프롬프트의 위치 이동 전략이 LLM 생성 순위에서의 위치 편향을 효과적으로 줄이는가?
- RQ5실제 추천 벤치마크에서 지시 미세조정된 LLM은 GPT-3.5-turbo와 같은 전용 LLM보다 성능이 뛰어나게 되는가?
주요 결과
- LLaMA-2 (13B) 모델은 모든 지표에서 7B 모델을 능가했으며, 더 큰 모델 규모가 추론 및 순위 매기기 성능 향상에 기여함을 입증했습니다.
- 하이브리드 순위 매기기 방법이 모든 평가 지표에서 최고 성능을 기록했으며, H@3 및 N@3에서 뚜렷한 향상을 보이며 다중 작업 학습의 유용성을 확인했습니다.
- 훈련 지시 수를 5.6K에서 56K로 늘임에 따라 일관된 성능 향상이 관찰되어 데이터 규모가 지시 미세조정된 LLM의 성능 향상에 결정적 영향을 미침을 보여주었습니다.
- RecRanker는 Bookcrossing 데이터셋에서 GPT-3.5-turbo를 능가했으며, 추천 작업에서 지시 미세조정이 제로샷 프롬프팅보다 효과적임을 입증했습니다.
- ML-100K 데이터셋에서 56K개의 지시를 사용할 경우 H@3는 0.0533, N@3는 0.0368를 기록하여 표준 벤치마크 데이터셋에서 뛰어난 성능을 보였습니다.
- 단일 A800 GPU에서 추론 시간은 평균 0.059초/아이템이었지만, 16개의 A800으로 훈련하는 데 약 4.6시간이 소요되어 높은 계산 비용을 겪고 있음을 시사했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.