Skip to main content
QUICK REVIEW

[논문 리뷰] ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation

Jiazheng Xu, Xiao Liu|arXiv (Cornell University)|2023. 04. 12.
Multimodal Machine Learning Applications인용 수 99
한 줄 요약

ImageReward는 텍스트-이미지 생성에 대한 일반 목적의 인간 선호 보상 모델이며, Reward Feedback Learning (ReFL)과 함께 인간 선호 피드백을 사용하여 확산 모델을 직접 조정한다.

ABSTRACT

We present a comprehensive solution to learn and improve text-to-image models from human preference feedback. To begin with, we build ImageReward -- the first general-purpose text-to-image human preference reward model -- to effectively encode human preferences. Its training is based on our systematic annotation pipeline including rating and ranking, which collects 137k expert comparisons to date. In human evaluation, ImageReward outperforms existing scoring models and metrics, making it a promising automatic metric for evaluating text-to-image synthesis. On top of it, we propose Reward Feedback Learning (ReFL), a direct tuning algorithm to optimize diffusion models against a scorer. Both automatic and human evaluation support ReFL's advantages over compared methods. All code and datasets are provided at \url{https://github.com/THUDM/ImageReward}.

연구 동기 및 목표

  • 텍스트-이미지 생성과 인간 선호 간의 불일치를 해소한다.
  • 텍스트-이미지 작업을 위한 일반 목적의 인간 선호 보상 모델을 만든다.
  • 인간 판단과 정렬된 확장 가능한 평가 지표를 제공한다.
  • 보상 점수기에 따라 확산 모델을 직접 미세조정하는 방법(ReFL)을 제안한다.
  • 기존 점수 메트릭 및 튜닝 방법 대비 향상을 시연한다.

제안 방법

  • 프롬프트 선택, 텍스트-이미지 평가, 이미지 랭킹으로 구성된 체계적인 인간 선호 주석 파이프라인을 개발하고 137k 비교 데이터셋을 구축한다.
  • BLIP 백본을 사용하고 프롬프트-이미지 쌍에 대한 랭킹 기반 손실로 보상 모델(ImageReward)을 학습한다.
  • 보상 지표로서 CLIP, Aesthetic, BLIP를 평가 기준으로 사용하고 인간 선호와의 정렬 우수성을 시연한다.
  • Reward Feedback Learning (ReFL)을 제안한다: 후반 디노이즈 단계에서 ImageReward의 보상으로부터 역전파하여 확산 모델을 직접 미세 조정한다.
  • 훈련 안정화를 위해 피드백에 무작위의 후반 디노이징 단계를 사용하고 보상 손실과 사전 학습 손실을 결합해 규제화를 한다.
  • ReFL을 Stable Diffusion v1.4에서 실험적으로 검증하고 다른 튜닝 방법과 비교한다.

실험 결과

연구 질문

  • RQ1일반 목적의 보상 모델이 텍스트-이미지 출력에 대한 인간의 선호를 신뢰성 있게 포착할 수 있는가?
  • RQ2ImageReward가 CLIP, Aesthetic, BLIP 등 기존 점수 메트릭보다 인간 판단과 더 잘 정렬되는가?
  • RQ3데이터 증강이나 손실 재가중에만 의존하지 않고 보상 신호를 사용해 확산 모델을 직접 개선할 수 있는가?
  • RQ4주석 파이프라인이 인간 선호 데이터의 품질과 합의에 어떤 영향을 미치는가?
  • RQ5ImageReward가 단일 이미지 또는 모델 전체 비교를 위한 자동 평가 지표로 효과적인가?

주요 결과

  • ImageReward는 텍스트-이미지 합성에 대한 인간 선호를 이해하는 데 있어 CLIP, Aesthetic, BLIP보다 각각 38.6%, 39.6%, 31.6% 우수한 성능을 보인다.
  • ImageReward는 인간 순위와 정렬에 일치하고 모델 및 샘플 간 구별 가능성이 CLIP 및 FID 기준점보다 더 우수하다.
  • ImageReward는 실제 사용자 프롬프트를 기반으로 텍스트-이미지 모델을 평가하고 순위를 매기는 시점에 제로샷 자동 지표로 유망하게 작용한다.
  • ReFL은 ImageReward 피드백을 사용해 확산 모델을 직접 미세 조정하여 여러 기준선 및 대안 튜닝 방법에 비해 인간 평가에서 최상의 성능을 달성한다.
  • ReFL은 보상 모델로부터의 직접 그래디언트 피드백을 제공함으로써 데이터 증강 및 손실 재가중 방식보다 우수한 이점을 보여준다.
  • 노이징 단계별 ImageReward 점수를 검토하면 신뢰할 수 있는 인간 선호 신호가 후반 단계(약 30+ 디노이징 스텝)에서 나타나 늦은 단계 튜닝의 효과를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.