Skip to main content
QUICK REVIEW

[논문 리뷰] Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization

Li Ding, Jenny Zhang|arXiv (Cornell University)|2023. 10. 18.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 인간 평가에서 유도된 다양성 메트릭을 학습하여 품질 다각도(Quality Diversity, QD) 최적화를 향상시키는 QDHF(Quality Diversity through Human Feedback)를 소개한다. 잠재 공간 투영에 대한 대비 학습을 통해 QDHF는 로봇 기반 및 이미지 생성 작업에서 기존의 비지도 학습 방법보다 뛰어난 다양성 탐색 성능를 달성하며, 수작업으로 제작된 메트릭과 동등한 성능을 보이며 탐색 능력과 해법의 다양성을 향상시킨다.

ABSTRACT

Reinforcement Learning from Human Feedback (RLHF) has shown potential in qualitative tasks where easily defined performance measures are lacking. However, there are drawbacks when RLHF is commonly used to optimize for average human preferences, especially in generative tasks that demand diverse model responses. Meanwhile, Quality Diversity (QD) algorithms excel at identifying diverse and high-quality solutions but often rely on manually crafted diversity metrics. This paper introduces Quality Diversity through Human Feedback (QDHF), a novel approach that progressively infers diversity metrics from human judgments of similarity among solutions, thereby enhancing the applicability and effectiveness of QD algorithms in complex and open-ended domains. Empirical studies show that QDHF significantly outperforms state-of-the-art methods in automatic diversity discovery and matches the efficacy of QD with manually crafted diversity metrics on standard benchmarks in robotics and reinforcement learning. Notably, in open-ended generative tasks, QDHF substantially enhances the diversity of text-to-image generation from a diffusion model and is more favorably received in user studies. We conclude by analyzing QDHF's scalability, robustness, and quality of derived diversity metrics, emphasizing its strength in open-ended optimization tasks. Code and tutorials are available at https://liding.info/qdhf.

연구 동기 및 목표

  • 열린 영역의 실제 작업에서 수작업으로 제작된 다양성 메트릭에 의존하는 QD 알고리즘의 한계를 해결하기 위해.
  • 사전 정의된 다양성 측정 기준 없이도 다양한 고성능 해법을 탐색할 수 있도록 QD 알고리즘을 가능하게 하기 위해.
  • 인간이 인식하는 다양성의 기준을 인간 피드백으로 대체하여 복잡한 최적화 작업에서 탐색 능력과 해법의 다양성을 향상시키기 위해.
  • QDHF를 통해 인간 피드백으로 학습된 다양성 메트릭의 확장성과 품질을 평가하기 위해.
  • 텍스트에서 이미지로의 디퓨전 모델 제어와 같은 생성 작업에서 QDHF의 효과성을 입증하기 위해.

제안 방법

  • QDHF는 해법 유사도에 대한 쌍별 인간 평가를 기반으로 다양성 메트릭을 유추함으로써 인간 피드백을 QD 프레임워크에 통합한다.
  • 잠재 공간 투영을 사용하여 해법을 연속적인 임bedding 공간에 표현함으로써 대비 학습에 적합한 공간을 확보한다.
  • 대비 학습을 적용하여 임베딩 공간을 인간이 인식하는 다양성과 일치시켜, 인간 평가를 반영한 메트릭을 학습한다.
  • 이 방법은 반복적으로 해법 공간을 탐색하고, 해법 쌍에 대한 인간 피드백을 수집하며 실시간으로 다양성 메트릭을 업데이트한다.
  • QDHF는 각각의 고유한 다양성 측정값과 함께 성능이 가장 높은 해법이 기록된 해법 아카이브를 유지한다.
  • 이 방법은 로봇 주행, 강화 학습, 이미지 생성을 위한 잠재 공간 조명 작업 등에서 평가되었다.

실험 결과

연구 질문

  • RQ1인간 피드백을 효과적으로 활용하여 비지도 학습 방법보다 뛰어난 다양성 메트릭을 학습시킬 수 있는가?
  • RQ2수작업으로 제작된 다양성 메트릭을 사용한 QD와 비교할 때 QDHF는 해법의 다양성과 성능 측면에서 어떻게 다른가?
  • RQ3텍스트에서 이미지로의 생성 작업과 같은 열린 영역의 생성 작업에서 QDHF는 탐색 능력과 해법의 다양성을 얼마나 향상시키는가?
  • RQ4QDHF가 학습한 다양성 메트릭은 다양한 작업 영역에서 얼마나 확장 가능하고 견고한가?
  • RQ5QDHF는 인간이 해법 간 차이를 인식하는 방식을 더 잘 반영하는 다양성 표현을 학습할 수 있는가?

주요 결과

  • QDHF는 벤치마크 로봇 QD 작업에서 최신 비지도 학습 방법보다 뚜렷이 뛰어난 성능을 보이며, 더 높은 다양성과 더 나은 해법 공간 커버리지 확보를 달성했다.
  • 잠재 공간 조명 작업에서 QDHF는 디퓨전 모델이 생성한 이미지의 다양성을 향상시켰으며, 사용자 연구 결과 QDHF가 생성한 출력물에 더 강한 선호도가 나타났다.
  • 특히 해법 공간의 탐색이 부족한 영역에서 QDHF는 AURORA 및 기타 기준 대비 다양성 표현의 척도를 더 잘 모델링하는 데 뛰어난 능력을 보였다.
  • QDHF가 학습한 다양성 메트릭은 상대적 거리 측정을 잘 반영하여 진정한 다양성과 강력한 일치를 보였다.
  • 표준 벤치마크에서 QDHF는 수작업으로 제작된 메트릭을 사용한 QD와 비교해 유사한 성능을 달성하여, QDHF가 플러그인 대체 수단으로서의 효과성을 입증했다.
  • 이 방법은 뛰어난 샘플 효율성과 확장성을 보이며, 복잡하고 열린 영역의 최적화 작업에 적합한 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.