Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to summarize from human feedback

Nisan Stiennon|arXiv (Cornell University)|2020. 09. 02.
Topic Modeling참고 문헌 71인용 수 37
한 줄 요약

본 논문은 인간 비교로부터 보상 모델을 학습하여 강화 학습으로 요약 정책을 미세조정하고, TL;DR에서 감독 학습 기준보다 더 높은 품질의 요약을 달성하며, 도메인 특화 파인튜닝 없이 CNN/DM로의 이전도 잘 수행한다.

ABSTRACT

As language models become more powerful, training and evaluation are increasingly bottlenecked by the data and metrics used for a particular task. For example, summarization models are often trained to predict human reference summaries and evaluated using ROUGE, but both of these metrics are rough proxies for what we really care about -- summary quality. In this work, we show that it is possible to significantly improve summary quality by training a model to optimize for human preferences. We collect a large, high-quality dataset of human comparisons between summaries, train a model to predict the human-preferred summary, and use that model as a reward function to fine-tune a summarization policy using reinforcement learning. We apply our method to a version of the TL;DR dataset of Reddit posts and find that our models significantly outperform both human reference summaries and much larger models fine-tuned with supervised learning alone. Our models also transfer to CNN/DM news articles, producing summaries nearly as good as the human reference without any news-specific fine-tuning. We conduct extensive analyses to understand our human feedback dataset and fine-tuned models We establish that our reward model generalizes to new datasets, and that optimizing our reward model results in better summaries than optimizing ROUGE according to humans. We hope the evidence from our paper motivates machine learning researchers to pay closer attention to how their training loss affects the model behavior they actually want.

연구 동기 및 목표

  • 간단한 참조 기반 지표가 아닌 인간 판단과의 정렬에 언어모델 요약을 맞추도록 동기를 부여한다.
  • 보상 모델을 학습하기 위해 인간 비교를 사용하는 배치 오프라인 파이프라인을 개발한다.
  • PPO로 인간 선호 보상을 최대화하도록 요약 정책을 미세조정한다.
  • 새로운 도메인으로의 일반화와 보상 모델의 동작을 분석한다.
  • 사람이 루프에 있는 요약에 대한 연구를 진전시키기 위해 데이터셋과 코드를 공개적으로 제공한다.

제안 방법

  • Reddit TL;DR 게시물의 후보 요약 간의 대규모 인간 비교를 수집한다.
  • 주어진 게시물에 대해 두 요약 간의 인간 선호를 예측하도록 보상 모델을 학습한다.
  • PPO로 보상 모델 출력을 최대화하도록 GPT-3 스타일 트랜스포머 정책을 미세조정하고, 감독 기준선에 가까이 머물도록 KL 페널티를 포함한다.
  • 오프라인 배치 기반 루프를 사용한다: 비교를 수집하고, 보상 모델을 학습하며, 정책을 최적화한 다음 새 정책에서 샘플링하여 더 많은 데이터를 수집한다.
  • 뉴스 도메인 파인튜닝 없이 CNN/DM으로의 전이를 평가하고 ROUGE 및 참조 요약과 비교한다.
  • 64k 이상의 인간 피드백 데이터셋을 공개하고 추론 코드 및 모델 카드를 제공한다.

실험 결과

연구 질문

  • RQ1인간 선호를 학습한 보상 모델이 참조 요약이나 더 큰 감독 학습 모델보다 인간이 선호하는 요약을 생성할 수 있는가?
  • RQ2보상 모델 주도 정책이 과제 특화 파인튜닝 없이 도메인 간 일반화(예: TL;DR에서 CNN/DailyMail로)를 수행하는가?
  • RQ3보상 모델의 품질과 규모가 최종 요약 및 인간 판단과의 정렬에 어떤 영향을 미치는가?
  • RQ4ROUGE나 다른 자동 지표에 맞추는 최적화가 인간 선호의 신뢰할 만한 대리척도인가?
  • RQ5요약 작업에서 인간 피드백으로 학습할 때의 한계와 위험은 무엇인가?

주요 결과

  • 인간 피드백으로 학습된 정책은 TL;DR에서 인간 선호 평가에서 강력한 감독 학습 기준을 능가한다.
  • 1.3B 및 6.7B 인간 피드백 모델은 감독 학습 상대를 능가하며 규모가 커질수록 이득이 커진다.
  • 뉴스 도메인 파인튜닝 없이도 인간 피드백 모델은 CNN/DM으로 참조에 근접한 품질의 전이를 보인다.
  • 보상 모델은 ROUGE나 로그 확률 측정치보다 인간 선호를 더 잘 예측하며, 이들에 맞춰 최적화하면 요약 품질이 더 좋아진다.
  • 데이터 증가 및 모델 크기 확대로 보상 모델의 성능이 향상되나 수익 체감도 있다.
  • 64,832 TL;DR 비교 및 관련 평가 데이터의 데이터셋이 공개적으로 공개된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.