Skip to main content
QUICK REVIEW

[논문 리뷰] Personalized Abstractive Summarization by Tri-agent Generation Pipeline

Wen Xiao, Yujia Xie|arXiv (Cornell University)|2023. 05. 04.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 대규모 언어 모델을 사용하여 개인화된 개별 요약을 위한 삼자이팅 파이프라인(생성기, 지도자, 편집자)을 제안한다. 피드백을 ChatGPT로부터 받는 편집자 주도 강화학습을 통해 미세튜닝된 소형 지도자 모델을 사용하여 사용자별 편집 지시문을 생성하며, DeFacto 및 CNNDM 데이터셋에서 사용자 선호도와의 일치도를 크게 향상시킨다.

ABSTRACT

Tailoring outputs from large language models, like ChatGPT, to implicit user preferences remains a challenge despite their impressive generative capabilities. In this paper, we propose a tri-agent generation pipeline comprising a generator, an instructor, and an editor to enhance output personalization. The generator produces an initial output, the instructor automatically generates editing instructions based on user preferences, and the editor refines the output to align with those preferences. The inference-only large language model (ChatGPT) serves as both the generator and editor, with a smaller model acting as the instructor to guide output generation. We train the instructor using editor-steered reinforcement learning, leveraging feedback from a large-scale editor model to optimize instruction generation. Experimental results on two abstractive summarization datasets demonstrate the effectiveness of our approach in generating outputs that better meet user expectations. Code is available at \url{https://github.com/Wendy-Xiao/chatgpt_editing_summ}

연구 동기 및 목표

  • 특정 사용자 요구에 맞게 LLM 기반 요약을 개인화하는 데 도전하는 것.
  • 일회성 생성의 한계를 극복하기 위해 반복적인 편집 및 개선 과정을 도입하는 것.
  • 큰 모델의 미세튜닝에 대한 의존도를 줄이기 위해 지시문 생성을 위한 더 작은 지도자 모델을 사용하는 것.
  • 지도자 모델의 지시문 생성을 사용자 요구사항과 더 잘 맞추기 위해 편집자 주도 강화학습을 적용하는 것.
  • 커버리지와 사실 일관성과 같은 핵심 사용자 기준을 기준으로 요약 생성에 대한 프레임워크를 평가하는 것.

제안 방법

  • 생성기(ChatGPT)가 입력 텍스트에서 초벌 요약을 생성한다.
  • 더 작은 지도자 모델이 사용자 요구사항에 기반해 자연어 편집 지시문을 생성한다.
  • 편집자(ChatGPT)가 지도자의 지시문을 바탕으로 초벌 요약을 수정한다.
  • 지도자 모델은 인간이 작성한 지시문으로 사전 학습된 후, 편집자 주도 강화학습을 통해 추가 최적화된다.
  • 강화학습의 보상 함수는 편집된 출력의 품질을 편집자 모델이 평가한 결과에 기반하며, ROUGE 및 사실 일관성 점수와 같은 자동 평가 지표로 측정된다.
  • 파이프라인은 다중 라운드의 지시문 생성 및 편집을 통해 사용자 기대에 더 잘 부합하는 반복적 개선을 지원한다.
Figure 1: Comparison between different generation paradigms. The middle one is from Welleck et al. ( 2022 ) .
Figure 1: Comparison between different generation paradigms. The middle one is from Welleck et al. ( 2022 ) .

실험 결과

연구 질문

  • RQ1큰 언어 모델 편집자에 의해 안내되는 작은 지도자 모델이 요약 품질을 크게 향상시키는 데 효과적인 편집 지시문을 생성할 수 있는가?
  • RQ2편집자 주도 강화학습이 지도자 모델이 생성한 지시문을 사용자 선호도와 더 잘 맞추는 데 얼마나 효과적인가?
  • RQ3삼자이팅 파이프라인에서의 반복적 편집은 단일 단계 생성보다 사용자 요구사항과의 일치도를 더 높이는가?
  • RQ4ROUGE 및 사실 일관성 측면에서 삼자이팅 파이프라인의 성능은 기준 모델 대비 어떻게 비교되는가?
  • RQ5이 프레임워크는 요약을 초월한 다른 NLP 작업, 예를 들어 위키 편집이나 수학 문제 생성 등으로 확장될 수 있는가?

주요 결과

  • 삼자이팅 파이프라인은 DeFacto 및 CNNDM 데이터셋 모두에서 사용자 요구사항과의 요약 일치도를 크게 향상시킨다.
  • 편집자 주도 강화학습을 통한 지도자 모델 훈련은 단순 지도 미세튜닝보다 더 효과적인 지시문 생성을 이끈다.
  • 삼자이팅 파이프라인을 통한 반복적 편집은 요약 품질을 추가로 향상시키며, 다중 개선 단계의 이점을 입증한다.
  • 최종 모델는 큰 모델의 최소한의 미세튜닝으로도 지도 기반 기준 모델과 유사한 ROUGE-L 점수를 달성한다.
  • 이 프레임워크는 ChatGPT를 편집자로 효과적으로 활용하며, 큰 모델의 직접적인 미세튜닝이 필요 없어져 계산 비용과 접근 장벽을 줄인다.
  • 이 방법은 위키 편집 및 수학 문제 생성과 같은 편집 중심의 다른 NLP 작업으로의 확장 가능성도 보여준다.
Figure 2: An illustration of the proposed tri-agent pipeline.
Figure 2: An illustration of the proposed tri-agent pipeline.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.