Skip to main content
QUICK REVIEW

[论文解读] Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization

Li Ding, Jenny Zhang|arXiv (Cornell University)|Oct 18, 2023
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出质量多样性人类反馈(QDHF),一种通过人类判断学习多样性度量的方法,以增强质量多样性(QD)优化。通过在潜在空间投影上应用对比学习,QDHF在机器人和图像生成任务中实现了更优的多样性发现,其性能优于无监督方法,并与手工设计的度量标准相当,同时提升了探索效率和解的多样性。

ABSTRACT

Reinforcement Learning from Human Feedback (RLHF) has shown potential in qualitative tasks where easily defined performance measures are lacking. However, there are drawbacks when RLHF is commonly used to optimize for average human preferences, especially in generative tasks that demand diverse model responses. Meanwhile, Quality Diversity (QD) algorithms excel at identifying diverse and high-quality solutions but often rely on manually crafted diversity metrics. This paper introduces Quality Diversity through Human Feedback (QDHF), a novel approach that progressively infers diversity metrics from human judgments of similarity among solutions, thereby enhancing the applicability and effectiveness of QD algorithms in complex and open-ended domains. Empirical studies show that QDHF significantly outperforms state-of-the-art methods in automatic diversity discovery and matches the efficacy of QD with manually crafted diversity metrics on standard benchmarks in robotics and reinforcement learning. Notably, in open-ended generative tasks, QDHF substantially enhances the diversity of text-to-image generation from a diffusion model and is more favorably received in user studies. We conclude by analyzing QDHF's scalability, robustness, and quality of derived diversity metrics, emphasizing its strength in open-ended optimization tasks. Code and tutorials are available at https://liding.info/qdhf.

研究动机与目标

  • 为解决QD算法在开放性、现实世界任务中依赖手工设计多样性度量的局限性。
  • 使QD算法能够在无预定义多样性度量的情况下发现多样且高质量的解。
  • 利用人类反馈作为人类感知多样性的代理,提升复杂优化任务中的探索效率和解的多样性。
  • 评估QDHF中通过人类反馈学习的多样性度量在可扩展性和质量方面的表现。
  • 展示QDHF在文本到图像扩散模型控制等生成任务中的有效性。

提出的方法

  • QDHF通过从成对的人类判断中推断解决方案相似性,将人类反馈整合到QD框架中,以学习多样性度量。
  • 利用潜在空间投影将解决方案表示为适合对比学习的连续嵌入空间。
  • 应用对比学习将嵌入空间与人类对多样性的感知对齐,学习反映人类判断的度量。
  • 该方法迭代探索解空间,收集人类对解对的反馈,并实时更新多样性度量。
  • QDHF维护一个解档案,其中每个唯一的多样性度量均关联最高性能的解。
  • 该方法在机器人导航、强化学习以及图像生成的潜在空间照明任务上进行了评估。

实验结果

研究问题

  • RQ1人类反馈能否有效用于学习优于无监督多样性发现的QD优化多样性度量?
  • RQ2与使用手工设计多样性度量的QD相比,QDHF在解的多样性和性能方面表现如何?
  • RQ3QDHF在开放性生成任务(如文本到图像生成)中,能在多大程度上提升探索效率和解的多样性?
  • RQ4QDHF学习的多样性度量在不同任务领域中的可扩展性和鲁棒性如何?
  • RQ5QDHF能否学习到更能反映人类对解差异真实感知的多样性表征?

主要发现

  • 在基准机器人QD任务中,QDHF显著优于最先进的无监督多样性发现方法,实现了更高的多样性并更全面地覆盖了解空间。
  • 在潜在空间照明任务中,QDHF增强了扩散模型生成图像的多样性,用户研究显示对QDHF生成结果的偏好更强。
  • 与AURORA及其他基线方法相比,QDHF在解空间中探索不足的区域,展现出更优的多样性表征尺度建模能力。
  • QDHF学习到的多样性度量与真实多样性高度一致,尤其在捕捉解之间相对距离方面表现优异。
  • 在标准基准测试中,QDHF的性能与使用手工设计度量的QD相当,验证了其作为即插即用替代方案的有效性。
  • 该方法表现出优异的样本效率和可扩展性,适用于复杂且开放的优化任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。