[论文解读] Efficient Meta Reinforcement Learning for Preference-based Fast Adaptation
该论文提出 ANOLE,一种元强化学习算法,通过使用人类偏好反馈而非数值奖励,实现快速、少样本的策略适应。通过将基于偏好的任务推理建模为噪声信道通信问题,并利用信息论中的 Berlekamp 体积,ANOLE 最大化每次查询的信息增益,在人类反馈存在噪声的情况下仍表现出稳健性能,在基准任务上的反馈效率和抗错能力优于基线方法。
Learning new task-specific skills from a few trials is a fundamental challenge for artificial intelligence. Meta reinforcement learning (meta-RL) tackles this problem by learning transferable policies that support few-shot adaptation to unseen tasks. Despite recent advances in meta-RL, most existing methods require the access to the environmental reward function of new tasks to infer the task objective, which is not realistic in many practical applications. To bridge this gap, we study the problem of few-shot adaptation in the context of human-in-the-loop reinforcement learning. We develop a meta-RL algorithm that enables fast policy adaptation with preference-based feedback. The agent can adapt to new tasks by querying human's preference between behavior trajectories instead of using per-step numeric rewards. By extending techniques from information theory, our approach can design query sequences to maximize the information gain from human interactions while tolerating the inherent error of non-expert human oracle. In experiments, we extensively evaluate our method, Adaptation with Noisy OracLE (ANOLE), on a variety of meta-RL benchmark tasks and demonstrate substantial improvement over baseline algorithms in terms of both feedback efficiency and error tolerance.
研究动机与目标
- 解决现有元强化学习方法在适应过程中需要访问环境奖励函数的局限性,这在真实世界的人机协同设置中不切实际。
- 仅通过行为轨迹之间的偏好反馈,实现新任务的快速策略适应,减少对精确奖励塑造的依赖。
- 设计一种查询策略,在每次人类反馈中最大化信息增益,同时对非专家反馈错误具有鲁棒性。
- 通过将偏好推理建模为噪声信道通信问题,弥合元强化学习与人机协同学习之间的鸿沟。
提出的方法
- 将基于偏好的任务推理问题建模为 Rényi-Ulam 游戏,将人类反馈视为通信信道中的噪声二值信号。
- 应用信息论中的 Berlekamp 体积量化噪声偏好反馈中的不确定性,并指导查询设计。
- 设计自适应查询序列,以最大化每次交互的信息增益,从而减少所需的人类查询次数。
- 将框架扩展至处理非参数化任务嵌入推理,避免对参数化奖励函数形式的假设。
- 在元强化学习主干上实现 ANOLE 算法,仅通过成对偏好比较实现快速适应。
- 采用基于仿真的反馈机制,其中偏好标签通过 MuJoCo 环境中步长奖励的求和生成,以模拟人类判断。
实验结果
研究问题
- RQ1元强化学习能否在无法访问环境奖励函数的情况下实现对新任务的快速适应?
- RQ2信息论原则如何用于设计人类偏好反馈在策略适应中的高效查询序列?
- RQ3元强化学习智能体在少样本适应过程中,对噪声或不一致的人类反馈的容忍程度如何?
- RQ4在复杂控制任务中,基于偏好的反馈是否能带来有效且高效的策略适应,而非数值奖励?
主要发现
- ANOLE 显著提升了反馈效率,在元强化学习基准任务上仅需 200 次人类查询即可达到优异性能。
- 该方法对噪声反馈表现出鲁棒性,在人类反馈错误率高达 10% 的情况下仍保持高性能。
- 在人类参与者实验中,平均反馈错误率为 6.2%,ANOLE 仍优于基线方法,在适应速度和最终策略质量方面表现更优。
- 利用 Berlekamp 体积进行不确定性量化,实现了有效的查询设计,最大化每次交互的信息增益。
- 在多种元强化学习基准任务中,ANOLE 在反馈效率和抗错能力方面均优于基线算法。
- 该方法实现了非参数化任务推理,避免了对奖励函数特定参数形式的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。