Skip to main content
QUICK REVIEW

[논문 리뷰] HIVE: Harnessing Human Feedback for Instructional Visual Editing

Shu Zhang, Xinyi Yang|arXiv (Cornell University)|2023. 03. 16.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

HIVE는 보상 모델링 및 토율 조정 파이프라인을 통해 인간 피드백을 통합하여 지시 기반 시각 편집 성능을 햖थ기 위한 프레임워크를 제안한다. 인간 선호도를 사용하여 확산 모델을 스케일링 가능하고 계산적으로 효율적으로 토율 조정하는 방법을 도입하여, 100만 개의 훈련 데이터, 3,600개의 보상 애너테이션, 1,000개의 평가 데이터를 활용해 최신 기준 성능을 달성하였으며, 정성적 및 정량적 기준에서 이전 방법들을 크게 능가한다.

ABSTRACT

Incorporating human feedback has been shown to be crucial to align text generated by large language models to human preferences. We hypothesize that state-of-the-art instructional image editing models, where outputs are generated based on an input image and an editing instruction, could similarly benefit from human feedback, as their outputs may not adhere to the correct instructions and preferences of users. In this paper, we present a novel framework to harness human feedback for instructional visual editing (HIVE). Specifically, we collect human feedback on the edited images and learn a reward function to capture the underlying user preferences. We then introduce scalable diffusion model fine-tuning methods that can incorporate human preferences based on the estimated reward. Besides, to mitigate the bias brought by the limitation of data, we contribute a new 1M training dataset, a 3.6K reward dataset for rewards learning, and a 1K evaluation dataset to boost the performance of instructional image editing. We conduct extensive empirical experiments quantitatively and qualitatively, showing that HIVE is favored over previous state-of-the-art instructional image editing approaches by a large margin.

연구 동기 및 목표

  • 지시 기반 이미지 편집 모델이 인간의 선호도와 의도, 특히 특정 시각적 구성 요소에 편집을 정확히 부착하지 못하는 데서 발생하는 격차를 해결하기 위해.
  • 강화 학습의 높은 계산 비용으로 인해 어려운 확산 모델 토율 조정에 인간 피드백을 효율적으로 통합할 수 있는 스케일링 가능하고 효율적인 방법을 개발하기 위해.
  • 지시 기반 편집에서의 데이터 편향 문제를 완화하기 위해 100만 개의 훈련 예제, 3,600개의 보상 애너테이션, 1,000개의 평가 샘플로 구성된 대규모이고 다양한 데이터셋을 수집하기 위해.
  • 다양한 출력에 대한 인간 선호도 학습을 통해 일반화 능력을 향상시키고 과도하거나 잘못된 편집을 줄이기 위해.
  • 인간 피드백이 편집 지시어와 생성된 출력 사이의 일치도를 크게 향상시키며, 특히 편집되지 않은 영역을 유지하는 데서 특히 효과적임을 입증하기 위해.

제안 방법

  • 기존 데이터와 InstructPix2Pix 데이터를 조합하여 100만 개 규모의 지시 기반 이미지 편집 데이터셋을 수집하여 기본 HIVE 모델을 사전 훈련한다.
  • 각 이미지-지시어 쌍에 대해 애너테이터가 여러 생성된 출력을 순위 매김하도록 요청하여 3,600개의 보상 학습 데이터셋을 확보한다.
  • 순위 매겨진 출력 기반으로 인간 선호도를 예측할 수 있는 보상 모델(RM)을 훈련시켜 사용자 의도와 품질 선호도를 포착한다.
  • 추정된 보상 값을 최소한의 계산 오버헤드로 확산 모델 훈련에 통합하는 두 가지 확장 가능한 토율 조정 목표인 가중 보상 손실과 조건 보상 손실을 제안한다.
  • 토율 조정 중 추정된 보상을 활용하여 확산 모델의 U-넷을 최적화함으로써, 비용이 많이 드는 온정책 강화 학습에 의존하지 않고도 편집 지시어와의 일치도를 향상시킨다.
  • 최신의 Stable Diffusion v2.1 백본과 OpenCLIP 텍스트 인코더를 활용하여 성능과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1인간 피드백은 사용자 의도와 선호도에 대한 지시 기반 이미지 편집 모델의 일치도를 상당히 향상시킬 수 있는가?
  • RQ2확산 모델 토율 조정에 인간 피드백을 통합할 수 있는 효율적인 방법은 무엇인가? 이는 금방이 되는 계산 비용을 초래하지 않는다.
  • RQ3대규모 인간 애너테이션 보상 데이터셋은 지시 기반 편집 모델의 강인성과 일반화 능력을 어느 정도 향상시키는가?
  • RQ4인간 피드백을 통합하면 과도하거나 잘못된 이미지 수정, 예를 들어 편집되지 않은 영역을 변경하는 일은 줄어드는가?
  • RQ5다른 보상 토율 조정 목표(가중 보상 vs. 조건 보상 손실)는 인간 선호도와 모델 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 사용자 선호도 연구에서 HIVE는 인간 피드백이 없는 HIVE 및 InstructPix2Pix보다 유의미하게 높은 성능을 보이며, 이중 비교에서 가장 많은 표를 확보했다.
  • 인간 피드백은 편집의 정확한 정위치를 향상시켜, 의도하지 않은 객체를 수정하거나 편집되지 않은 배경 영역을 변경하는 등의 오류를 줄였다.
  • 인간 피드백을 통한 모델은 지시된 편집 외부의 원본 이미지 콘텐츠를 더 잘 유지하며, 불필요한 과도한 편집을 최소화했다.
  • 조건 보상 손실과 가중 보상 손실 변형 모두 인간 선호도 순위에서 거의 동일한 결과를 보이며, 다양한 최적화 전략에 대해 뛰어난 안정성을 입증했다.
  • Stable Diffusion v1.5에서 v2.1로 업그레이드하면 성능이 약간이지만 일관되게 향상되며, v2.1을 사용하는 HIVE는 v1.5 기반 모델보다 더 높은 인간 선호도 점수를 확보했다.
  • 실패 사례로는 공간적 또는 줌 인 지시어의 오해, 세어보기 오류, 잘못된 객체 색상 교체 등이 있으며, 이는 훈련 데이터 커버리지의 한계를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.