Skip to main content
QUICK REVIEW

[論文レビュー] Pearl: Personalizing Large Language Model Writing Assistants with Generation-Calibrated Retrievers

Sheshera Mysore, Zhuoran Lu|arXiv (Cornell University)|Nov 15, 2023
Topic Modeling被引用数 4
ひとこと要約

Pearlは、生成に合わせてキャリブレーションされた検索器を用いて、ユーザー固有の履歴文書を活用して出力をパーソナライズする、大規模言語モデル(LLM)向けのライティングアシスタントを提案する。検索器は、ユーザー固有の履歴文書をプロンプトに補完するために選択し、新しいデータ選択法とスケールキャリブレーション済みのKLダイバージェンス損失を用いて、パーソナライズされたテキスト生成を最適化するように訓練される。Pearlは、職場やRedditにおけるテキスト生成タスクにおいて、自動評価および人的評価の両面で強力なベースラインを上回る性能を発揮する。

ABSTRACT

Powerful large language models have facilitated the development of writing assistants that promise to significantly improve the quality and efficiency of composition and communication. However, a barrier to effective assistance is the lack of personalization in LLM outputs to the author's communication style, specialized knowledge, and values. In this paper, we address this challenge by proposing Pearl, a LLM writing assistant personalized with a retriever that is trained to be generation-calibrated for personalization. Generation calibration ensures that our retriever selects historic user authored documents to augment an LLM prompt such that they are likely to help an LLM generation better adhere to a users' preferences. We propose two key novelties for training such a retriever: (1) A training data selection method that identifies user requests likely to benefit from personalization and documents that provide that benefit; and (2) A scale-calibrating KL-divergence objective that ensures that our retriever scores remain proportional to the downstream generation quality from using the document for personalized generation. In a series of holistic evaluations, we demonstrate the effectiveness of Pearl in generating long-form texts on multiple social media datasets. Finally, we demonstrate how a generation-calibrated retriever can double as a performance predictor -- detecting low quality retrieval, and improving potentially under-performing outputs via revision with LLMs.

研究の動機と目的

  • LLM出力のパーソナライズ不足が、ライティングアシスタントにおけるユーザーの信頼と採用を制限しているという問題に対処すること。
  • ユーザー固有の履歴文書を検索して統合することで、LLM出力の関連性とスタイルの一貫性を向上させること。
  • 一般的な検索ではなく、パーソナライズド・ジェネレーション性能に直接最適化された検索器を訓練すること。
  • 低品質な生成物に対して性能を予測するための二重の用途を検索器に与えること。
  • 職場のソーシャルメディア投稿やRedditのコメントといった実世界のライティングタスクにおける有効性を実証すること。

提案手法

  • 生成に合わせてキャリブレーションされた検索器を訓練し、与えられたリクエストに対して、ユーザー固有の履歴文書を最も適切にパーソナライズするものを選択する。
  • データ選択法により、パーソナライズの恩恵を受ける可能性が高いユーザーのリクエストと、その恩恵をもたらす文書を特定する。
  • スケールキャリブレーション済みのKLダイバージェンス損失により、補助的生成モデルからのスコアを検索器に蒸留し、検索とパーソナライズド・ジェネレーション品質を一致させる。
  • 検索器が選択した文書を少数の例として提示することで、LLMのプロンプトを補完し、パーソナライズド・ジェネレーションをガイドする。
  • 同じ検索器スコアを用いて生成品質を予測し、低品質な出力に対してより複雑なLLMチェイニングを効果的に選択的に適用できるようにする。
  • 自動評価指標と人的評価を用いて、企業内での業務コミュニケーションおよび公開のRedditコメントデータセット上で、システムを評価する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーの履歴的ライティングを用いた検索拡張的手法が、LLM出力のパーソナライズに効果的であるか。
  • RQ2生成に合わせてキャリブレーションされた検索器は、標準的な検索ベースラインと比較して、パーソナライズド・テキスト生成において優れているか。
  • RQ3検索器のスコアは生成品質を予測し、LLMチェイニングをガイドするために利用可能か。
  • RQ4パーソナライズが、生成されたテキストにおけるスタイル的整合性および事実的整合性をどの程度向上させるか。
  • RQ5この手法は、職場コミュニケーションやソーシャルメディアなど、異なるライティング分野に一般化可能か。

主な発見

  • Pearlは、パーソナライズド・ライティングタスクにおける自動評価指標および人的評価の両面で、強力な検索拡張ベースラインを上回る。
  • 生成に合わせてキャリブレーションされた検索器は、非キャリブレーションベースラインと比較して、LLM出力の関連性とスタイルの一貫性を顕著に向上させる。
  • 検索器のスコアは、低品質な生成物を効果的に予測でき、出力品質を向上させるためにより複雑なLLMチェイニングを効果的に選択的に適用可能である。
  • この手法は、企業内での業務コミュニケーションおよび公開のRedditコメント生成タスクの両方で、優れた性能を示す。
  • スケールキャリブレーション済みのKLダイバージェンス損失は、検索とパーソナライズド・ジェネレーションの目的を効果的に一致させ、生成品質に顕著な向上をもたらす。
  • 人的評価により、Pearlが生成する出力が、トーン、構成、および参照テキストとの類似性の観点で、ベースラインを上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。