Skip to main content
QUICK REVIEW

[논문 리뷰] RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting

Lei Shu, Liangchen Luo|arXiv (Cornell University)|2023. 05. 25.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 최소한의 인간 레이블 데이터를 사용하여 교차 문장 텍스트 재작성에 특화된 지시 미세조정을 받은 대규모 언어 모델인 RewriteLM을 소개한다. 위키 편집 마이닝, 사고의 사슬 프롬프팅, 보상 모델링을 위한 새로운 랭킹 함수를 활용하여 RewriteLM는 새로운 OpenRewriteEval 벤치마크에서 최신 기술 성능을 달성하였으며, 다양한 재작성 유형에서 기초 LLM 및 지시 미세조정 기반 모델들을 크게 앞서며 뛰어난 성능을 보였다.

ABSTRACT

Large Language Models (LLMs) have demonstrated impressive capabilities in creative tasks such as storytelling and E-mail generation. However, as LLMs are primarily trained on final text results rather than intermediate revisions, it might be challenging for them to perform text rewriting tasks. Most studies in the rewriting tasks focus on a particular transformation type within the boundaries of single sentences. In this work, we develop new strategies for instruction tuning and reinforcement learning to better align LLMs for cross-sentence rewriting tasks using diverse wording and structures expressed through natural languages including 1) generating rewriting instruction data from Wiki edits and public corpus through instruction generation and chain-of-thought prompting; 2) collecting comparison data for reward model training through a new ranking function. To facilitate this research, we introduce OpenRewriteEval, a novel benchmark covers a wide variety of rewriting types expressed through natural language instructions. Our results show significant improvements over a variety of baselines. The public repository is available on GitHub under Google Research (https://github.com/google-research/google-research/tree/master/rewritelm).

연구 동기 및 목표

  • 교차 문장 텍스트 재작성에 특화된 LLM을 훈련하는 데 있어 모델이 내용을 유지하지 못하거나 환각 현상을 유발하는 문제를 해결하기 위해.
  • 비용이 많이 드는 인간 레이블 데이터에 의존도를 줄이기 위해 지시 미세조정 및 보상 모델링을 위한 자동화된 데이터 수집 전략을 개발하기 위해.
  • 자연어 지시를 통해 다양한 재작성 유형을 지원하는 새로운 벤치마크인 OpenRewriteEval을 구축하기 위해.
  • 다차원 보상 함수와 강화학습을 통합하여 재작성 작업에서 모델의 제어성과 출력 품질을 향상시키기 위해.
  • 지시 미세조정 및 RL 미세조정을 거친 LLM이 일반 목적의 지시 미세조정 모델보다 개방형 재작성 작업에서 뛰어난 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 위키 수정 기록에서 교차 문장 편집을 추출하고, 지시 생성 및 사고의 사슬 프롬프팅을 적용하여 다양한 재작성 예제를 생성함.
  • 공개 코퍼스에서 사고의 사슬 프롬프팅을 사용하여 합성된 지시-재작성 쌍을 생성하고, 후처리를 통해 데이터셋의 다양성을 향상시킴.
  • 보상 모델 훈련을 위한 비교 데이터를 자동으로 수집하기 위해 새로운 랭킹 함수를 설계함. 이는 내용 유지, 환각 여부, 언어적 다양성, 길이 변화 등 재작성 품질을 평가함.
  • 자동으로 생성된 지시 데이터를 사용하여 감독 미세조정 모델(Rewrite-PaLM)을 훈련시켜 모델을 재작성 지시에 맞추어 정렬함.
  • 감독 미세조정 모델 위에 랭킹 함수를 사용하여 강화학습을 적용하여 출력 품질을 추가로 최적화함.
  • 다양한 재작성 유형과 교차 문장 변환을 포함하는 자연어 지시를 제공하는 인간 레이블이 부여된 재작성 예제를 포함한 새로운 벤치마크인 OpenRewriteEval을 도입함.

실험 결과

연구 질문

  • RQ1최소한의 인간 레이블 데이터를 사용하여 대규모 언어 모델을 교차 문장 텍스트 재작성에 효과적으로 미세조정할 수 있는가?
  • RQ2위키 편집 마이닝 및 사고의 사슬 프롬프팅과 같은 자동화된 데이터 생성 기법이 재작성 작업을 위한 고품질 지시 미세조정 데이터를 생성하는 데 얼마나 효과적인가?
  • RQ3학습된 랭킹 함수가 보상 모델 훈련을 위한 인간 레이블 비교 데이터를 대체할 수 있는가?
  • RQ4지시 미세조정 LLM에 강화학습을 적용할 경우 재작성 품질이 얼마나 향상되는가?
  • RQ5다양하고 개방형인 재작성 벤치마크에서 RewriteLM는 최신 기술의 지시 미세조정 및 기초 LLM과 비교해 어떻게 성능을 내는가?

주요 결과

  • Rewrite-RL${}_{\text{r/w}}$-PaLM 2-S는 OpenRewriteEval에서 가장 높은 성능을 기록하였으며, 'elaborate' 유형에서는 SARI 점수 20.15, 'updated' 유형에서는 26.32를 기록함.
  • Rewrite-PaLM 2-S는 기초 모델인 PaLM 2-S보다 큰 성능 향상을 보였으며, 'elaborate' 유형에서 SARI 점수 18.13, 'updated' 유형에서 25.55를 기록함.
  • 지시 미세조정 모델인 Rewrite-Flan-PaLM-62B와 Rewrite-PaLM-62B는 각각 'elaborate' 유형에서 SARI 점수 17.92와 16.44를 기록하며 기초 모델을 크게 앞서며 뛰어난 성능을 보임.
  • 랭킹 함수를 사용한 보상 모델 훈련 전략은 모든 평가 유형에서 일관된 향상을 이끌었으며, 최고의 모델은 기초 지시 미세조정 모델 대비 SARI 점수 30%의 상대적 향상을 기록함.
  • Flan-PaLM 및 Alpaca와 같은 최신 기술의 지시 미세조정 모델들도 개방형 재작성 작업에서는 제한된 성능을 보이며, 전용 미세조정의 필요성을 입증함.
  • OpenRewriteEval 벤치마크는 현재 LLM이 교차 문장 재작성에서 내용 유지 및 환각 방지를 위해 어려움을 겪고 있음을 드러내며, 목표 지향적 훈련의 필요성을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.