Skip to main content
QUICK REVIEW

[논문 리뷰] Pearl: Personalizing Large Language Model Writing Assistants with Generation-Calibrated Retrievers

Sheshera Mysore, Zhuoran Lu|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 4
한 줄 요약

Pearl은 사용자 맞춤형 역사 문서를 검색하여 프롬프트를 보강함으로써 출력을 개인화하는 검색 기반 대규모 언어 모델(LM) 글쓰기 보조도구를 제안한다. 검색 모듈은 새로운 데이터 선택 방법과 척도 캘리브레이션된 KL 발산 손실을 통해 개인화된 텍스트 생성을 최적화하기 위해 훈련된다. Pearl은 직장 내 커뮤니케이션 및 Reddit 댓글 생성 작업에서 자동 평가와 수동 평가 모두에서 강력한 기준 모델을 능가한다.

ABSTRACT

Powerful large language models have facilitated the development of writing assistants that promise to significantly improve the quality and efficiency of composition and communication. However, a barrier to effective assistance is the lack of personalization in LLM outputs to the author's communication style, specialized knowledge, and values. In this paper, we address this challenge by proposing Pearl, a LLM writing assistant personalized with a retriever that is trained to be generation-calibrated for personalization. Generation calibration ensures that our retriever selects historic user authored documents to augment an LLM prompt such that they are likely to help an LLM generation better adhere to a users' preferences. We propose two key novelties for training such a retriever: (1) A training data selection method that identifies user requests likely to benefit from personalization and documents that provide that benefit; and (2) A scale-calibrating KL-divergence objective that ensures that our retriever scores remain proportional to the downstream generation quality from using the document for personalized generation. In a series of holistic evaluations, we demonstrate the effectiveness of Pearl in generating long-form texts on multiple social media datasets. Finally, we demonstrate how a generation-calibrated retriever can double as a performance predictor -- detecting low quality retrieval, and improving potentially under-performing outputs via revision with LLMs.

연구 동기 및 목표

  • LLM 생성 텍스트의 개인화 부족이 사용자 신뢰와 글쓰기 보조도구의 도입을 제한한다는 점을 해결하기 위해.
  • 사용자 고유의 역사적 문서를 검색하고 통합하여 LLM 출력의 관련성과 스타일 일관성을 향상시키기 위해.
  • 일반적인 검색을 위한 것이 아니라 개인화된 생성 성능을 직접 최적화하기 위해 검색 모듈을 훈련시키기 위해.
  • 낮은 품질의 생성 결과를 예측하는 데도 검색 모듈을 이중 기능으로 활용하기 위해.
  • 직장 내 소셜 미디어 게시물과 Reddit 댓글과 같은 실제 글쓰기 작업에서의 효과성을 입증하기 위해.

제안 방법

  • 생성에 캘리브레이션된 검색 모듈은 특정 요청에 대해 가장 잘 개인화된 LLM 응답을 이끌어내기 위해 사용자가 작성한 이전 문서를 선택하도록 훈련된다.
  • 데이터 선택 방법은 개인화에 기여할 가능성이 높은 사용자 요청과 그 기여를 제공하는 문서를 식별한다.
  • 척도 캘리브레이션된 KL 발산 손실은 보조 생성 모델의 점수를 검색 모듈에 흡수하여 검색과 개인화된 생성 품질 간의 일치를 도모한다.
  • 검색 모듈이 선택한 문서를 소수의 예시로 사용해 LLM 프롬프트를 보강함으로써 개인화된 생성을 이끈다.
  • 동일한 검색 모듈 점수를 사용해 생성 품질을 예측하고, 낮은 품질의 출력에 대해 더 복잡한 LLM 체이닝을 선택적으로 적용한다.
  • 자동 평가 지표와 수동 평가를 모두 사용해 엔터프라이즈 수준의 직장 커뮤니케이션 및 공개된 Reddit 댓글 데이터셋에서 시스템을 평가한다.

실험 결과

연구 질문

  • RQ1사용자의 이전 글을 기반으로 한 검색 기반 접근 방식이 LLM 생성 텍스트의 개인화에 효과적으로 기여할 수 있는가?
  • RQ2기본적인 검색 기반 기준 모델 대비 생성에 캘리브레이션된 검색 모듈은 개인화된 텍스트 생성에서 어떤 성능을 보이는가?
  • RQ3검색 모듈의 점수는 생성 품질을 예측하고 LLM 체이닝을 이끄는 데 사용될 수 있는가?
  • RQ4얼마나까지 개인화가 생성된 텍스트의 스타일 일관성과 사실 일관성 향상에 기여하는가?
  • RQ5이 방법은 직장 커뮤니케이션과 소셜 미디어와 같은 다양한 글쓰기 도메인으로 일반화되는가?

주요 결과

  • Pearl은 개인화된 글쓰기 작업에서 자동 평가 지표와 수동 평가 모두에서 강력한 검색 기반 보조 기준 모델을 능가한다.
  • 생성에 캘리브레이션된 검색 모듈은 비캘리브레이션 기준 모델 대비 LLM 출력의 관련성과 스타일 일관성을 크게 향상시킨다.
  • 검색 모듈의 점수는 낮은 품질의 생성 결과를 성공적으로 예측하여, 더 복잡한 LLM 체이닝을 낮은 품질의 출력에 대해 선택적으로 적용할 수 있게 한다.
  • 이 방법은 엔터프라이즈 수준의 직장 커뮤니케이션과 공개된 Reddit 댓글 생성 작업 모두에서 뛰어난 성능을 보여준다.
  • 척도 캘리브레이션된 KL 발산 손실은 검색과 개인화된 생성 목표 간의 일치를 효과적으로 도모하여 생성 품질 향상에 측정 가능한 기여를 한다.
  • 수동 평가 결과에 따르면, Pearl이 생성한 출력은 기준 모델 대비 톤, 구조, 기준 텍스트와의 정보 내용 유사성 측면에서 선호된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.