Skip to main content
QUICK REVIEW

[논문 리뷰] Training Language Models with Language Feedback

Jérémy Scheurer, Jon Ander Campos|arXiv (Cornell University)|2022. 04. 29.
Topic Modeling인용 수 11
한 줄 요약

이 논문은 쌍별 비교가 아닌 자연어 피드백을 사용하여 언어 모델을 피지컬러닝하는 세 단계 방법을 제안한다. 이는 인간의 피드백에 기반해 초반 생성 결과를 개선함으로써 더 높은 품질의 출력을 생성할 수 있도록 한다. 단지 100개의 인간이 작성한 피드백 예시만으로도 GPT-3(175B 파라미터)가 인간 수준의 요약 성능을 달성하며, 대규모 모델이 세부적인 피드백을 효과적으로 통합하여 출력 품질을 향상시킬 수 있음을 보여준다.

ABSTRACT

Pretrained language models often do not perform tasks in ways that are in line with our preferences, e.g., generating offensive text or factually incorrect summaries. Recent work approaches the above issue by learning from a simple form of human evaluation: comparisons between pairs of model-generated task outputs. Comparison feedback conveys limited information about human preferences per human evaluation. Here, we propose to learn from natural language feedback, which conveys more information per human evaluation. We learn from language feedback on model outputs using a three-step learning algorithm. First, we condition the language model on the initial output and feedback to generate many refinements. Second, we choose the refinement with the highest similarity to the feedback. Third, we finetune a language model to maximize the likelihood of the chosen refinement given the input. In synthetic experiments, we first evaluate whether language models accurately incorporate feedback to produce refinements, finding that only large language models (175B parameters) do so. Using only 100 samples of human-written feedback, our learning algorithm finetunes a GPT-3 model to roughly human-level summarization ability.

연구 동기 및 목표

  • 선호도 학습에서 쌍별 비교 피드백의 한계를 해결하기 위해, 각 인간 평가당 최소한의 정보를 전달한다는 점.
  • 더 많은 세부 정보를 담고 있는 자연어 피드백이 언어 모델이 인간의 선호도와 일치시키는 데 도움이 되는지 탐색하기 위해.
  • 인간이 작성한 피드백을 사용하여 강화학습을 사용하지 않고도 확장 가능한 언어 모델의 피지컬러닝 방법을 개발하기 위해.
  • 대규모 언어 모델이 복잡한 피드백을 정확히 해석하고 적용하여 출력을 개선할 수 있는지 평가하기 위해.

제안 방법

  • 입력, 초반 출력, 그리고 인간이 작성한 피드백을 기반으로 대규모 언어 모델을 조건화하여 다수의 개선 버전을 생성한다.
  • 피드백와의 임베딩 기반 유사도를 사용해 각 개선 버전을 평가하고, 가장 높은 점수를 받은 것을 선택한다.
  • 선택된 개선 버전을 기반으로 언어 모델을 피지컬러닝하여, 입력에 대해 해당 버전을 최대 가능도로 생성하도록 한다.
  • 세 단계 파이프라인을 사용: 개선 버전 생성, 피드백 인식 선택, 지도 학습을 통한 피지컬러닝.
  • 대규모 모델의 지시 따르기 능력을 활용하여 자연어 피드백을 해석하고 실행한다.
  • 강화학습이나 보조 손실을 회피함으로써 자연어 피드백을 직접 적용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델은 세부적인 자연어 피드백을 정확히 통합하여 출력을 개선할 수 있는가?
  • RQ2특히 통제된 합성 작업에서 모델 크기에 따라 피드백 통합 성능가 어떻게 달라지는가?
  • RQ3작은 수의 인간이 작성한 피드백 예시(예: 100개)로 요약 작업에서 인간 수준의 성능을 달성할 수 있는가?
  • RQ4피드백 인식 개선 버전 선택 방식이 기준 모델 또는 피드백 무시 모델 대비 출력 품질을 얼마나 향상시키는가?
  • RQ5언어 모델이 생성한 개선 버전이 인간 피드백의 의도와 내용을 얼마나 잘 반영하고 있는가?

주요 결과

  • 합성된 모욕적 단어 제거 작업에서 오직 가장 큰 GPT-3 모델(175B 파라미터)만 정확하게 피드백을 통합하였으며, 개선 정확도는 38.5%였다.
  • 작은 모델들(예: Ada, Babbage, Curie)은 평균 2.5% 미만으로 훨씬 낮은 정확도를 보였다.
  • 단지 100개의 인간이 작성한 피드백 샘플만으로도 인간 평가자들이 선호하는 요약 품질을 51%의 경우에서 달성하며 인간 기준 수준에 가까워졌다.
  • 개선 버전 생성 단계에서 피드백이 성공적으로 통합되었으며, 특히 다수의 후보 중에서 유사도가 가장 높은 출력을 선택했을 때 두드러졌다.
  • 기준 모델 출력 및 피드백 간섭 없는 개선 버전보다도 성능이 뛰어나며, 질적 사례 분석에서 피드백 기반 개선 버전은 初기 요약에서 누락된 핵심 정보를 포함한 것으로 확인되었다.
  • 분석 결과, 임베딩 기반 유사도가 피드백와 일치하는 개선 버전을 효과적으로 식별함을 확인하여 선택 전략의 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.