[論文レビュー] Bridging Items and Language: A Transition Paradigm for Large Language Model-Based Recommendation
本稿では、ID、タイトル、属性を組み合わせた多面的識別子を用いて大規模言語モデル(LLMs)とレコメンデーションシステムを橋渡しする、新しい遷移パラダイム「TransRec」を提案する。これにより、意味的豊かさと一意性の両方を実現する。制約付きで位置に依存しない生成と、グランドイングモジュールを導入し、3つの実世界データセットにおいてフルショットおよびフェイシング設定の両方で、レコメンデーションの正確性と一般化性能が著しく向上する。
Harnessing Large Language Models (LLMs) for recommendation is rapidly emerging, which relies on two fundamental steps to bridge the recommendation item space and the language space: 1) item indexing utilizes identifiers to represent items in the language space, and 2) generation grounding associates LLMs' generated token sequences to in-corpus items. However, previous methods exhibit inherent limitations in the two steps. Existing ID-based identifiers (e.g., numeric IDs) and description-based identifiers (e.g., titles) either lose semantics or lack adequate distinctiveness. Moreover, prior generation grounding methods might generate invalid identifiers, thus misaligning with in-corpus items. To address these issues, we propose a novel Transition paradigm for LLM-based Recommender (named TransRec) to bridge items and language. Specifically, TransRec presents multi-facet identifiers, which simultaneously incorporate ID, title, and attribute for item indexing to pursue both distinctiveness and semantics. Additionally, we introduce a specialized data structure for TransRec to ensure generating valid identifiers only and utilize substring indexing to encourage LLMs to generate from any position of identifiers. Lastly, TransRec presents an aggregated grounding module to leverage generated multi-facet identifiers to rank in-corpus items efficiently. We instantiate TransRec on two backbone models, BART-large and LLaMA-7B. Extensive results on three real-world datasets under diverse settings validate the superiority of TransRec.
研究の動機と目的
- 既存のアイテムインデックス手法が、意味的豊かさ(記述ベース)と一意性(IDベース)の両方を犠牲にしているという問題を解決すること。
- 自己回帰的LLMベースのレコメンデーションにおけるコーパス外識別子生成の問題を克服すること。
- 初期トークンに依存する必要を減らし、ユーザーの好みを反映しない可能性がある識別子の初期部分に依存しないこと。
- 任意の部分文字列から生成できるようにすることで、LLMが識別子を位置に依存せずに生成できるようにすること。
- コーパス内識別子の予測を保証する、堅牢な生成グランドイングメカニズムの開発
提案手法
- アイテムID、タイトル、属性を組み合わせた多面的識別子を提案し、一意性と意味的表現力を両立する。
- 有効なコーパス内識別子に限定して生成を制約する専用のデータ構造を導入し、コーパス外出力を防止する。
- 部分文字列インデックスを採用することで、LLMが任意の位置から識別子を生成できるようにし、位置に依存しない生成を実現する。
- LLMの出力語彙を有効な識別子に限定する制約付き生成戦略を採用し、計算コストを削減する。
- ID、タイトル、属性の複数の識別子フェイズからの一致スコアを統合する、集約型グランドイングモジュールを設計し、堅牢なアイテム検索を実現する。
- BART-largeおよびLLaMA-7BにTransRecを実装し、レコメンデーションタスクのためのインstructチューニングデータで微調整する。
実験結果
リサーチクエスチョン
- RQ1ID、タイトル、属性を組み合わせた多面的識別子は、LLMベースのレコメンデーションにおいて、一意性と意味的豊かさの両方を向上させることができるか?
- RQ2制約付き生成は、コーパス外識別子の生成を防止し、レコメンデーションの信頼性を向上させることができるか?
- RQ3部分文字列インデックスによって実現される位置に依存しない生成は、識別子の初期トークンに依存する必要を減らすことができるか?
- RQ4TransRecは、挑戦的なフェイシングおよびコールドスタートレコメンデーション設定でどの程度の性能を示すか?
- RQ5集約型グランドイングモジュールは、複数の識別子フェイズからの信号を効果的に統合し、レコメンデーションの正確性を向上させることができるか?
主な発見
- TransRecは、フルトレーニング、フェイシング、コールドスタートのあらゆる設定において、3つの実世界データセットで最先端の性能を達成する。
- 多面的識別子の設計により、意味的豊かさと一意性のバランスを取ることで、レコメンデーションの正確性が著しく向上する。
- 制約付き生成により、コーパス外レコメンデーションが削減され、語彙の制限によってグランドイングの正確性が向上する。
- 位置に依存しない生成により、初期トークンが曖昧または情報が乏しい場合でも、より柔軟で正確な識別子生成が可能になる。
- 集約型グランドイングモジュールにより、ID、タイトル、属性フェイズからの一致スコアを統合することで、レコメンデーションの堅牢性が向上する。
- 実験結果から、特にコールドスタートやフェイシング学習のような低データ環境において、正確性と一般化性能の両方で一貫した向上が確認される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。