Skip to main content
QUICK REVIEW

[논문 리뷰] OpenP5: An Open-Source Platform for Developing, Training, and Evaluating LLM-based Recommender Systems

Shuyuan Xu, Wenyue Hua|arXiv (Cornell University)|2023. 06. 19.
Topic Modeling인용 수 7
한 줄 요약

OpenP5는 추천 시스템을 위한 기초 모델을 Pre-train, Personalized Prompt, and Predict (P5) 철학을 사용하여 벤치마킹하는 오픈소스 라이브러리입니다. 이 라이브러리는 10개의 인기 있는 데이터셋에서 두 가지 유형의 후행 작업—순차적 및 간단한 추천—을 지원하며, 세 가지 아이템 인덱싱 방법(랜덤, 순차적, 협업 기반)을 제공하고, 통합된 슈퍼 P5 모델을 포함한 사전 학습 체크포인트를 제공하여 대부분의 벤치마크에서 최고 성능을 기록하고 강력한 제로샷 일반화 성능을 확보합니다.

ABSTRACT

In recent years, the integration of Large Language Models (LLMs) into recommender systems has garnered interest among both practitioners and researchers. Despite this interest, the field is still emerging, and the lack of open-source R&D platforms may impede the exploration of LLM-based recommendations. This paper introduces OpenP5, an open-source platform designed as a resource to facilitate the development, training, and evaluation of LLM-based generative recommender systems for research purposes. The platform is implemented using encoder-decoder LLMs (e.g., T5) and decoder-only LLMs (e.g., Llama-2) across 10 widely recognized public datasets, catering to two fundamental recommendation tasks: sequential and straightforward recommendations. Recognizing the crucial role of item IDs in LLM-based recommendations, we have also incorporated three item indexing methods within the OpenP5 platform: random indexing, sequential indexing and collaborative indexing. Built on the Transformers library, the platform facilitates easy customization of LLM-based recommendations for users. OpenP5 boasts a range of features including extensible data processing, task-centric optimization, comprehensive datasets and checkpoints, efficient acceleration, and standardized evaluations, making it a valuable tool for the implementation and evaluation of LLM-based recommender systems. The open-source code and pre-trained checkpoints for the OpenP5 library are publicly available at https://github.com/agiresearch/OpenP5.

연구 동기 및 목표

  • 추천 시스템에서 기초 모델에 대한 표준화된 벤치마크의 부족을 해결하기 위해.
  • LLM 기반 추천 시스템의 훈련, 평가, 비교를 위한 통합적이고 재현 가능한 플랫폼을 제공하기 위해.
  • 개인화된 프롬프트를 사용하여 순차적 및 간단한 추천 작업을 모두 지원하기 위해.
  • 모든 10개 데이터셋에 대해 사전 학습된 단일 슈퍼 P5 모델을 통해 다중 도메인 추천을 가능하게 하기 위해.
  • 다양한 아이템 인덱싱 방법이 생성적 추천 성능에 미치는 영향을 탐구하기 위해.

제안 방법

  • 프레임워크는 T5-small 모델을 기반으로 하며, P5 철학을 사용해 미세조정됩니다: 사용자-아이템 상호작용 데이터로 사전 학습한 후, 개인화된 프롬프트를 적용해 미세조정합니다.
  • 개인화된 프롬프트는 사용자 ID, 아이템 ID, 데이터셋 이름을 사용하여 제로샷 일반화를 가능하게 하고, 데이터셋 간 환각 현상을 방지합니다.
  • 세 가지 아이템 인덱싱 방법이 구현되어 있습니다: 랜덤(랜덤 숫자 토큰), 순차적(시간 순서), 협업 기반(사용자-아이템 상호작용 패턴 기반).
  • 균형 잡힌 훈련 전략은 데이터셋과 작업 간 배치를 번갈아가며 사용하여, 특히 슈퍼 P5 훈련에서 데이터 불균형과 치명적 잊힘을 완화합니다.
  • 개별 데이터셋용 사전 학습 체크포인트(P5)와 모든 10개 데이터셋에 대해 훈련된 통합 슈퍼 P5 모델을 제공합니다.
  • 평가에는 순차적 및 간단한 추천 작업 모두에 대해 표준 지표인 HR@k와 NDCG@k를 사용합니다.

실험 결과

연구 질문

  • RQ1아이템 인덱싱 방법(랜덤, 순차적, 협업 기반)의 선택이 LLM 기반 추천 시스템 성능에 어떤 영향을 미치는가?
  • RQ2단일 통합 모델(Super P5)이 도메인 특화 미세조정 없이 다양한 추천 도메인에서 뛰어난 성능을 달성할 수 있는가?
  • RQ3특히 순차적 추천에서, OpenP5는 새로운 프롬프트 템플릿에 대해 제로샷 설정에서 얼마나 잘 일반화되는가?
  • RQ4다중 데이터셋 슈퍼 P5 모델 훈련 시 데이터 불균형과 치명적 잊힘의 영향은 어떠한가?
  • RQ5OpenP5는 기존의 순차적 및 협업 필터링 기반 베이스라인과 비교해 추천 정확도 측면에서 어떤가?

주요 결과

  • OpenP5는 대부분의 데이터셋과 지표에서 최고 성능을 기록했으며, 협업 기반 인덱싱 방법이 랜덤 및 순차적 인덱싱보다 뛰어난 성능을 보였습니다.
  • 슈퍼 P5 모델은 ML-1M 데이터셋에서 여러 베이스라인을 초월하여 강력한 다중 도메인 일반화 능력을 입증했습니다.
  • 순차적 추천의 경우, OpenP5는 강력한 제로샷 일반화 성능을 보였으며, 일부 데이터셋(예: ML-1M, LastFM)에서는 알려지지 않은 프롬프트에서 보다 뛰어난 성능을 기록했습니다.
  • 간단한 추천의 경우, 새로운 프롬프트에서 성능이 저하되었는데, 이는 프롬프트 템플릿에 의해 사용자 ID 임베딩이 지배당하기 때문일 수 있습니다.
  • Beaut 및 LastFM와 같은 작은 데이터셋에서는 슈퍼 P5에서 성능이 최적화되지 않았는데, 이는 다중 데이터셋 훈련 중 과적합과 데이터 불균형이 원인일 수 있습니다.
  • 이 라이브러리는 기초 모델의 추천 시스템 평가를 효율적이고 재현 가능하게 가능하게 하며, 포괄적인 사전 학습 체크포인트와 표준화된 벤치마크를 제공합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.