Skip to main content
QUICK REVIEW

[논문 리뷰] eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction Data

Bo Peng, Xinyi Ling|arXiv (Cornell University)|2024. 02. 13.
Recommender Systems and Techniques인용 수 4
한 줄 요약

이 논문은 10개의 다양한 전자상거래 작업을 포함하는 대규모 고품질 오픈소스 지침 데이터셋인 ECInstruct 기반으로 구축된 전자상거래를 위한 지시 미세조정된 대규모 언어 모델인 eCeLLM을 소개한다. eCeLLM은 도메인 내 평가에서 GPT-4와 전문 모델을 뛰어넘으며, 새로운 제품과 새로운 지침을 포함한 도메인 외 시나리오에 대해서도 강력한 일반화 능력을 보이며, 최고의 기준 모델 대비 새로운 제품에서 9.3% 향상된 성능을 기록한다.

ABSTRACT

With tremendous efforts on developing effective e-commerce models, conventional e-commerce models show limited success in generalist e-commerce modeling, and suffer from unsatisfactory performance on new users and new products - a typical out-of-domain generalization challenge. Meanwhile, large language models (LLMs) demonstrate outstanding performance in generalist modeling and out-of-domain generalizability in many fields. Toward fully unleashing their power for e-commerce, in this paper, we construct ECInstruct, the first open-sourced, large-scale, and high-quality benchmark instruction dataset for e-commerce. Leveraging ECInstruct, we develop eCeLLM, a series of e-commerce LLMs, by instruction-tuning general-purpose LLMs. Our comprehensive experiments and evaluation demonstrate that eCeLLM models substantially outperform baseline models, including the most advanced GPT-4, and the state-of-the-art task-specific models in in-domain evaluation. Moreover, eCeLLM exhibits excellent generalizability to out-of-domain settings, including unseen products and unseen instructions, highlighting its superiority as a generalist e-commerce model. Both the ECInstruct dataset and the eCeLLM models show great potential in empowering versatile and effective LLMs for e-commerce. ECInstruct and eCeLLM models are publicly accessible through https://ninglab.github.io/eCeLLM.

연구 동기 및 목표

  • 새로운 사용자와 새로운 제품에 대해 전문 모델의 일반화 능력과 일반 모델링 능력에 한계가 있음을 해결하기 위해.
  • 다양한 전자상거래 응용 분야에서 대규모 언어 모델(LM)을 효과적으로 활용하기 위한 격차를 메우기 위해 고품질의 대규모 지침 데이터셋을 구축하기 위해.
  • 다양한 작업에서 뛰어난 성능을 보이며, 새로운 데이터에 효과적으로 일반화되는 일반 전자상거래 기초 모델을 개발하기 위해.
  • 냉각기 문제를 극복하기 위해 새로운 제품과 새로운 지침에 대해 zero-shot 및 few-shot 일반화를 가능하게 하기 위해.

제안 방법

  • ECInstruct를 구축: 116,528개의 샘플을 포함하며, 4개의 카테고리에 걸쳐 10개의 실제 전자상거래 작업을 다루는 오픈소스 지침 데이터셋으로, 입력, 지시, 출력 및 선택적 옵션을 포함한다.
  • 실제 사용자 쿼리와 제품 상호작용에서 유래한 고품질, 다양하고 현실적인 전자상거래 지시 데이터를 수집 및 정제한다.
  • Llama 2와 Mistral을 포함한 6종의 일반 목적 LLM을 ECInstruct를 사용한 지시 미세조정을 통해 eCeLLM 모델 시리즈를 개발한다.
  • 도메인 내(IND) 및 도메인 외(OOD) 테스트 세트를 포함하는 평가 프로토콜을 설계하며, OOD 샘플은 새로운 제품과 새로운 지시를 포함한다.
  • eCeLLM을 다중 설정에서 평가: 전체 학습, few-shot, zero-shot 설정을 포함하며, 새로운 제품과 새로운 지시에 대한 OOD 일반화도 포함한다.
  • 엄격한 인간 평가 및 자동 평가를 통해 제품 설명 생성, 속성 추출, 질의 응답 등 다양한 전자상거래 작업에서의 성능을 검증한다.
Figure 1 : Overall scheme of $\mathop{\mathtt{eCeLLM}}\limits$ instruction-tuned with $\mathop{\mathtt{ECInstruct}}\limits$
Figure 1 : Overall scheme of $\mathop{\mathtt{eCeLLM}}\limits$ instruction-tuned with $\mathop{\mathtt{ECInstruct}}\limits$

실험 결과

연구 질문

  • RQ1지시 미세조정된 LLM이 전문 모델과 GPT-4에 비해 전자상거래 작업 전반에서 뛰어난 성능을 달성할 수 있는가?
  • RQ2eCeLLM이 미세조정 없이도 새로운 제품과 새로운 지시와 같은 도메인 외 설정에 얼마나 잘 일반화되는가?
  • RQ3ECInstruct 데이터셋의 규모와 품질이 결과로 도출된 eCeLLM 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ4단일 일반 전자상거래 LLM이 여러 전문 모델을 대체하면서도 그 성능을 유지하거나 초월할 수 있는가?
  • RQ5학습 데이터의 다양성과 지시 품질이 전자상거래 LLM의 zero-shot 및 few-shot 일반화에 어떤 영향을 미치는가?

주요 결과

  • eCeLLM 모델들은 모든 10개 작업에서 도메인 내 평가에서 최고의 기준 모델 대비 평균 10.7% 향상된 성능을 기록한다.
  • eCeLLM은 도메인 내 설정에서 GPT-4 Turbo보다 모든 10개 작업에서 뛰어난 성능을 보이며, 강력한 경쟁 성능을 입증한다.
  • 새로운 제품이 포함된 도메인 외 설정에서 eCeLLM은 최고의 기준 모델 대비 9.3% 향상된 성능을 기록하며, 강력한 일반화 능력을 입증한다.
  • eCeLLM은 zero-shot 및 few-shot 설정에서도 뛰어난 성능을 유지하며, 분포 변화와 데이터 부족 상황에 강건함을 보인다.
  • ECInstruct 데이터셋은 새로운 지시에 대한 효과적인 zero-shot 전이를 가능하게 하여, 일반 모델링에 있어 그 유용성을 확인한다.
  • 고품질 지시 데이터와 지시 미세조정의 조합은 eCeLLM이 새로운 작업과 제품 카테고리로 효과적으로 일반화할 수 있도록 하며, 전자상거래의 냉각기 문제를 해결한다.
(a) IND Evaluation
(a) IND Evaluation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.