Skip to main content
QUICK REVIEW

[논문 리뷰] Human Feedback is not Gold Standard

Tom Hosking, Phil Blunsom|arXiv (Cornell University)|2023. 09. 28.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 인간 피드백이 대규모 언어 모델의 평가나 훈련을 위한 신뢰할 수 있는 골드 표준이라는 가정에 도전한다. 인간 피드백이 사실성과 관련된 요소를 충분히 반영하지 못하고, 주장성 같은 혼란 요인에 의해 편향되어 있음을 입증한다. 이로 인해 모델들은 더 주장적으로 변하지만 사실성은 떨어지는 경향이 있다. 연구는 인간의 평가가 완전히 객관적이거나 종합적이지 않음을 드러내며, 인간 피드백을 주요 훈련 목표로 삼는 데 신중함이 필요하다고 경고한다.

ABSTRACT

Human feedback has become the de facto standard for evaluating the performance of Large Language Models, and is increasingly being used as a training objective. However, it is not clear which properties of a generated output this single `preference' score captures. We hypothesise that preference scores are subjective and open to undesirable biases. We critically analyse the use of human feedback for both training and evaluation, to verify whether it fully captures a range of crucial error criteria. We find that while preference scores have fairly good coverage, they under-represent important aspects like factuality. We further hypothesise that both preference scores and error annotation may be affected by confounders, and leverage instruction-tuned models to generate outputs that vary along two possible confounding dimensions: assertiveness and complexity. We find that the assertiveness of an output skews the perceived rate of factuality errors, indicating that human annotations are not a fully reliable evaluation metric or training objective. Finally, we offer preliminary evidence that using human feedback as a training objective disproportionately increases the assertiveness of model outputs. We encourage future work to carefully consider whether preference scores are well aligned with the desired objective.

연구 동기 및 목표

  • 인간 피드백이 LLM 평가 및 훈련에 널리 사용되는 골드 표준으로서 사실성, 일관성과 같은 핵심 품질 기준을 신뢰할 만하게 반영하는지 조사하기 위해.
  • 선호도 점수가 모델 출력에서 사실성, 일관성, 반복성과 같은 중요한 오류 유형을 충분히 대표하는지 평가하기 위해.
  • 모델 출력의 주장성 및 복잡성과 같은 혼란 요인들이 인간 평가자들의 판단에 영향을 주는지 조사하기 위해.
  • 인간 피드백을 훈련 목표로 사용할 경우 모델 출력 특성, 특히 주장성에 어떤 영향을 미치는지 평가하기 위해.
  • 기준 응답이 종종 모델 출력보다 낮게 평가되므로 기준 기반 평가의 타당성을 의심할 근거를 제시하기 위해.

제안 방법

  • 모델 출력의 최소 품질 기준으로서 임의의 작업에 관계없는 오류 기준(예: 사실성, 일관성 부족, 반복, 거부)을 정의하였다.
  • 두 가지 조건에서 인간 평가를 수집하였다: 하나는 평가자가 종합적인 품질을 독립적으로 평가한 경우이고, 다른 하나는 먼저 특정 오류 유형을 평가한 후 종합 품질을 평가한 경우로, 프라밍 효과를 테스트하기 위함이었다.
  • 지시 테이닝된 LLM(Cohere, Falcon, MPT, Command)를 사용하여 주장성과 복잡성에 대한 제어된 변동을 가진 모델 출력을 생성하여 혼란 요인의 영향을 탐색하였다.
  • 오류 평가와 종합 선호도 점수 간의 상관관계를 측정하여 커버리지와 편향 여부를 평가하였다.
  • 응답 길이와 품질 점수 간의 관계를 분석하여 길이와 반복성 또는 사실성 오류 간의 트레이드오프를 규명하였다.
  • 기준 응답과 모델 출력 간의 품질 점수를 비교하여 기준 기반 벤치마크의 타당성을 평가하였다.
Figure 1: Weightings for each criteria under a Lasso regression model of overall scores. Almost all the criteria contribute to the overall scores, with refusal contributing most strongly.
Figure 1: Weightings for each criteria under a Lasso regression model of overall scores. Almost all the criteria contribute to the overall scores, with refusal contributing most strongly.

실험 결과

연구 질문

  • RQ1인간 평가에서 사용되는 선호도 점수가 LLM 출력의 사실성 및 일관성과 같은 중요한 오류 유형을 충분히 반영하는가?
  • RQ2인간 평가자가 모델 품질을 평가할 때 주장성 및 복잡성과 같은 혼란 요인의 영향을 얼마나 받는가?
  • RQ3인간 피드백을 훈련 목표로 사용할 경우 모델의 주장성이 비례적으로 증가하는가?
  • RQ4인간 평가자들이 종합적인 품질 평가에서 특정 오류 유형과 얼마나 관련이 있는가? 오류 기준을 먼저 제시하면 프라밍 효과가 발생하는가?
  • RQ5기준 응답이 항상 모델 출력보다 더 높은 품질로 평가되는가? 이는 평가 벤치마크에 어떤 함의를 갖는가?

주요 결과

  • 선호도 점수는 오류 유형을 상당히 잘 커버하지만, 사실성 및 충실성 오류는 크게 부족하게 반영되어 있어 골드 표준으로서의 신뢰도가 제한적임을 시사한다.
  • 평가자들이 사실성에 대한 평가에서 모델 출력의 주장성에 강하게 편향되어 있으며, 잘못된 내용임에도 주장성이 높은 출력은 더 사실적인 것으로 인식된다.
  • 측정 가능한 프라밍 효과가 존재한다: 먼저 특정 오류 유형을 평가한 평가자들이 종합 품질 점수에서 해당 오류 유형과 더 강하게 상관관계를 보였으며, 이는 최종 판단에 영향을 미침을 시사한다.
  • 일정 길이 이하에서는 더 긴 응답이 선호되지만, 반복성 및 사실성 오류 비율은 길이가 증가함에 따라 증가하여 품질 측면에서 길이와의 트레이드오프가 존재함을 시사한다.
  • 기준 응답은 항상 모델 출력보다 종합 품질 점수에서 낮게 평가되었으며, 이는 기준 기반 평가의 타당성을 의심하게 한다.
  • 초기 증거에 따르면 인간 피드백을 보상 신호로 사용해 모델를 피지테이닝할 경우 모델 출력의 주장성이 비례적으로 증가하는 경향이 있으며, 이는 사실성 정확도의 손실을 동반할 수 있다.
Figure 2: Difference in annotated error rates for distractor examples (outputs from the same model but different input). Some error types are correctly unchanged (e.g., repetition, refusal) while relevance and inconsistency are correctly penalised. Factuality and contradiction are both incorrectly p
Figure 2: Difference in annotated error rates for distractor examples (outputs from the same model but different input). Some error types are correctly unchanged (e.g., repetition, refusal) while relevance and inconsistency are correctly penalised. Factuality and contradiction are both incorrectly p

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.