Skip to main content
QUICK REVIEW

[論文レビュー] LaMP: When Large Language Models Meet Personalization

Alireza Salemi, Sheshera Mysore|arXiv (Cornell University)|Apr 22, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、テキスト分類および生成をカバーする7つの多様なタスクにわたり、パーソナライズド言語モデルを評価するための包括的ベンチマーク「LaMP」を紹介する。ユーザーのプロフィールを用いたリtrieval増強プロンプトを提案し、ゼロショットおよび微調整済みのLLM性能を向上させ、ベンチマーク全体で微調整設定で平均23.5%、ゼロショット設定で12.2%の相対的改善を達成した。

ABSTRACT

This paper highlights the importance of personalization in large language models and introduces the LaMP benchmark -- a novel benchmark for training and evaluating language models for producing personalized outputs. LaMP offers a comprehensive evaluation framework with diverse language tasks and multiple entries for each user profile. It consists of seven personalized tasks, spanning three text classification and four text generation tasks. We additionally propose two retrieval augmentation approaches that retrieve personal items from each user profile for personalizing language model outputs. To this aim, we study various retrieval models, including term matching, semantic matching, and time-aware methods. Extensive experiments on LaMP for zero-shot and fine-tuned language models demonstrate the efficacy of the proposed retrieval augmentation approach and highlight the impact of personalization in various natural language tasks.

研究の動機と目的

  • 実世界のNLPアプリケーションにおけるパーソナライズド大規模言語モデル(LLM)を評価するための包括的ベンチマークの不足に対処すること。
  • ユーザー基準および時間基準の両方のパーソナライゼーション設定をサポートする統一された評価フレームワークの構築。
  • トークン制限を超えないようにユーザーのプロフィールをLLMプロンプトに統合するための有効なリトリーブベースの手法の調査。
  • 多様で実世界のユーザーデータを用いて、ゼロショットおよび微調整済みのLLMのパーソナライズドタスクにおけるベースラインパフォーマンスの確立。
  • リトリーブ増強プロンプトが複数のNLPタスクにわたり、パーソナライゼーションを向上させる有効性の実証。

提案手法

  • LaMPベンチマークは、3つのテキスト分類タスク(引用情報特定、映画タグ付け、製品評価)と4つのテキスト生成タスク(ニュース見出し、学術的タイトル、メール件名、ツイートの言い換え)を含む7つのパーソナライズドタスクから構成される。
  • ユーザーのプロフィールは、過去の入力および承認済み出力を含む、ユーザーの履歴的インタラクションとして定義され、各ユーザーのパーソナライズドコンテキストを形成する。
  • 2つのリトリーブ増強プロンプティング戦略を提案:プロンプト内増強(IPA)は、プロフィール項目を直接プロンプトに取得して挿入する方法であり、デコーダー内統合は、デコーディング中にプロフィール項目をエンコードおよび統合する方法である。
  • 関連するパーソナライズドアイテムをプロンプト増強に使用するため、語句マッチング、意味的マッチング、時間に配慮したリトリーブ手法を含む複数のリトリーブモデルを評価した。
  • 2つのデータ分割をサポート:ユーザー基準(新規ユーザー用)および時間基準(既存ユーザーの将来のインタラクション用)、これにより汎化性能および長期的パーソナライゼーションの評価が可能になる。
  • 性能は標準指標を用いて評価される:分類タスクでは正解率/F1、順序評価ではMAE/RMSE、生成タスクではROUGE-1/ROUGE-L。

実験結果

リサーチクエスチョン

  • RQ1リトリーブ増強プロンプティングは、多様なNLPタスクにわたり、パーソナライズド言語モデルのパフォーマンスをどの程度向上させるか?
  • RQ2微調整とリトリーブ増強付きゼロショットプロンプティングの両方が、パーソナライズドLLMに与える相対的影響は何か?
  • RQ3語句マッチング、意味的マッチング、時間に配慮したリトリーブ手法といった異なるリトリーブ戦略は、パーソナライズド出力の質にどのような影響を与えるか?
  • RQ4ゼロショットおよび微調整設定の両方で、ユーザーのプロフィールを統合することで、モデルのパフォーマンスはどの程度向上するか?
  • RQ5SVM、BERT、BARTなどの標準的な非パーソナライズドモデルは、パーソナライズドタスクにおいてリトリーブ増強LLMと比べてどの程度の性能を示すか?

主な発見

  • リトリーブ増強プロンプティングはLLMのパフォーマンスを顕著に向上させ、プロフィールリトリーブを用いた微調整設定では、全タスクで平均23.5%の相対的改善を達成した。
  • ゼロショット設定でも、FlanT5-XXLのような市販のLLMよりも平均12.2%の相対的改善が得られた。
  • 特にツイートの言い換えやメール件名生成といった生成タスクにおいて、デコーダー内統合(fusion-in-decoder)アプローチがプロンプト内増強(in-prompt augmentation)を上回った。
  • 意味的マッチングモデルは、語句マッチングや時間に配慮した手法よりも、ベンチマーク全体で一貫して優れた性能を示し、特に複雑な生成タスクで顕著だった。
  • BERT や BART などの非パーソナライズドベースラインは、リトリーブ増強LLMに比べて性能が劣っており、引用情報特定タスクではBERTが0.584の正解率、ニュース見出し生成タスクではBARTがROUGE-Lで0.171を記録した。
  • 時間基準の分割設定では、リトリーブ増強モデルの汎化性能が強く、将来のユーザーインタラクションへの適応性が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。