Skip to main content
QUICK REVIEW

[論文レビュー] Integrating Summarization and Retrieval for Enhanced Personalization via Large Language Models

Chris Richardson, Yao Zhang|arXiv (Cornell University)|Oct 30, 2023
Topic Modeling被引用数 4
ひとこと要約

本論文は、LLMが生成するユーザーレビューを用いてNLPシステムにおけるパーソナライゼーションを強化する要約拡張型リtrievalフレームワークを提案する。リアルタイムのリtrievalに依存することを減らす。タスクに適した要約を事前に生成することで、75%のデータ収集量削減を達成しながら、リtrievalオンリーベースラインと同等またはそれ以上のパフォーマンスを実現し、特にコールドスタート状況や音声アシスタントのような低遅延アプリケーションで効果を発揮する。

ABSTRACT

Personalization, the ability to tailor a system to individual users, is an essential factor in user experience with natural language processing (NLP) systems. With the emergence of Large Language Models (LLMs), a key question is how to leverage these models to better personalize user experiences. To personalize a language model's output, a straightforward approach is to incorporate past user data into the language model prompt, but this approach can result in lengthy inputs exceeding limitations on input length and incurring latency and cost issues. Existing approaches tackle such challenges by selectively extracting relevant user data (i.e. selective retrieval) to construct a prompt for downstream tasks. However, retrieval-based methods are limited by potential information loss, lack of more profound user understanding, and cold-start challenges. To overcome these limitations, we propose a novel summary-augmented approach by extending retrieval-augmented personalization with task-aware user summaries generated by LLMs. The summaries can be generated and stored offline, enabling real-world systems with runtime constraints like voice assistants to leverage the power of LLMs. Experiments show our method with 75% less of retrieved user data is on-par or outperforms retrieval augmentation on most tasks in the LaMP personalization benchmark. We demonstrate that offline summarization via LLMs and runtime retrieval enables better performance for personalization on a range of tasks under practical constraints.

研究の動機と目的

  • リtrievalベースのパーソナライゼーションの限界、すなわち情報損失、浅いユーザ理解、コールドスタート問題を解決する。
  • 入力長および遅延制約を克服するため、ユーザーデータの要約処理をオフライン処理に移譲する。
  • 低データまたは新規ユーザーシナリオにおけるパーソナライゼーションパフォーマンスを、高レベルでタスクに適したユーザーレビューを活用することで向上させる。
  • 音声アシスタントのようなリアルタイムで低遅延を要するアプリケーションが、事前計算された要約を通じてLLMの力を活用できるようにする。
  • 要約処理が多様なNLPタスクにおけるパフォーマンスを損なわせることなく、大規模リtrievalへの依存度を低下させられることを実証する。

提案手法

  • ユーザーヒストリーやタスクコンテキストに基づき、大規模言語モデル(例:Vicuna、GPT-3.5)を用いて、事前にタスクに適したユーザーレビューを生成する。
  • 推論時に低遅延でリtrieval可能な知識ベースにこれらの要約を格納する。
  • 推論時に、収集したユーザーデータに加えて事前計算された要約を、リtrieval増強生成に組み込む。
  • 要約モデルがタスクに応じて関連する側面(例:文章スタイル、好み)に焦点を当てるように、プロンプト工学戦略を用いる。
  • 推論時に要約とリtrievalを統合し、モデルが高レベルの要約と具体的なデータポイントの両方にアクセスできるようにする。
  • 分類および生成タスクを含むLaMPベンチマーク上でFlanT5-baseモデルを微調整し、さまざまなリtrievalおよび要約設定におけるパフォーマンスを評価する。
Figure 1. Personalization is achieved by combining runtime-retrieved samples with an offline-generated user summary. Given a textual input $x$ that describes a task in natural language, the goal is to generate a personalized output $y$ for users. The retrieval model identifies the most relevant item
Figure 1. Personalization is achieved by combining runtime-retrieved samples with an offline-generated user summary. Given a textual input $x$ that describes a task in natural language, the goal is to generate a personalized output $y$ for users. The retrieval model identifies the most relevant item

実験結果

リサーチクエスチョン

  • RQ1LLMが生成するユーザーレビューは、パーソナライズドNLPタスクにおいてリアルタイムリtrievalの代替または削減に効果的に機能するか?
  • RQ2オフライン要約処理は、リtrieバルオンリーメソッドと比較して、低データまたはコールドスタートユーザーシナリオでのパフォーマンスをどの程度向上させるか?
  • RQ3要約モデルの品質(例:GPT-3.5対Vicuna)が、下流のパーソナライゼーションパフォーマンスに与える影響はいかほどか?
  • RQ4リtrieバルと要約のハイブリッドアプローチは、入力長および推論コストを削減しながら、精度を維持または向上させられるか?
  • RQ5リtrieバルが無効化された状況でも、どのタスクで要約処理がパフォーマンス優位性を発揮するか?

主な発見

  • GPT-3.5が生成する要約を用いた本手法は、LaMP-1(正解率:0.743 vs. 0.709)およびLaMP-2(正解率:0.814 vs. 0.807)において、k=4のリtrieバルオンリーベースラインを上回り、より少ないデータ量で優れた結果を達成した。
  • LaMPベンチマークの6つのタスクのうち5つにおいて、本手法はリtrieバルオンリーベースラインと同等またはそれ以上のパフォーマンスを達成したが、収集データ量は75%削減された。
  • LaMP-1では、オフライン要約のみ(k=0)を用いた手法が、k=4のリtrieバルオンリーベースライン(正解率:0.709)を上回る正解率0.738を達成し、データが乏しい状況でも有効であることを示した。
  • GPT-3.5が生成する要約は、Vicunaが生成する要約よりも一貫して優れたパフォーマンスを示し、これはモデルサイズおよび推論品質の差によるものと推定される。
  • LaMP-1およびLaMP-2において、本手法はベースラインと比較して統計的に有意な改善(p < 0.05)を示し、タスク全体にわたる堅牢性を示した。
  • LaMP-4やLaMP-5のようなタスクでは、最小限のリtrieバルでパフォーマンスを維持またはわずかに向上させた。これは、高品質な要約が広範なリtrieバルに代わる可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。