Skip to main content
QUICK REVIEW

[论文解读] Using Cognitive Models to Train Warm Start Reinforcement Learning Agents for Human-Computer Interactions

Chao Zhang, Shihan Wang|arXiv (Cornell University)|Mar 10, 2021
Reinforcement Learning in Robotics参考文献 28被引用 5
一句话总结

本文提出使用认知模型(如证据积累模型和ACT-R)来模拟人类用户行为,并预训练强化学习(RL)智能体以用于人机交互,从而实现‘热启动’RL,减少对真实用户交互的依赖。该方法在促进体力活动方面实现了更高的行为影响,在驾驶车道保持辅助方面也表现出色,表明基于模型的仿真可显著提升真实部署前的初始策略性能。

ABSTRACT

Reinforcement learning (RL) agents in human-computer interactions applications require repeated user interactions before they can perform well. To address this "cold start" problem, we propose a novel approach of using cognitive models to pre-train RL agents before they are applied to real users. After briefly reviewing relevant cognitive models, we present our general methodological approach, followed by two case studies from our previous and ongoing projects. We hope this position paper stimulates conversations between RL, HCI, and cognitive science researchers in order to explore the full potential of the approach.

研究动机与目标

  • 解决强化学习(RL)在人机交互(HCI)中面临的冷启动问题,即智能体需经过大量用户交互才能学习到有效策略。
  • 通过利用认知模型生成合成用户交互数据,克服数据密集型RL的局限性。
  • 通过使用经过验证的心理学模型模拟用户行为,实现RL智能体在真实世界HCI应用中的更快收敛与性能提升。
  • 将认知建模与RL相结合,支持无需大规模历史用户数据的个性化、自适应交互系统。
  • 探索认知科学、HCI与RL之间的协同作用,以构建更高效、更友好的交互系统。

提出的方法

  • 使用证据积累模型(EAMs)和ACT-R等认知架构,模拟交互环境中的人类决策与学习过程。
  • 基于认知模型构建一个随机性人类模拟器,用于生成合成用户交互数据,包括下一状态和奖励。
  • 利用人类模拟器生成的模拟数据对RL智能体进行预训练,使其在与真实用户部署前即学习到初始策略。
  • 将认知模型参数(如决策阈值、偏好)整合到奖励函数中,引导RL智能体影响认知状态。
  • 在仿真环境中验证预训练的RL策略,并在可能的情况下通过人机协同实验评估其在现实世界中的有效性。
  • 结合历史行为数据与心理学理论(如记忆与决策机制),以增强模拟用户模型的真实性。

实验结果

研究问题

  • RQ1认知模型能否有效模拟交互任务中的人类用户行为,从而实现RL智能体的预训练?
  • RQ2与在真实用户交互中进行冷启动训练相比,使用认知模型生成的数据进行预训练在多大程度上提升了RL智能体的性能?
  • RQ3在训练个性化RL智能体时,认知模型在多大程度上能够体现用户行为的个体差异?
  • RQ4使用经验验证的认知模型对预训练RL策略的泛化能力与可靠性有何影响?
  • RQ5认知模型与RL的整合能否形成反馈回路,通过智能体表现来验证和优化认知理论?

主要发现

  • 在体力活动促进案例中,使用基于认知模型模拟器预训练的RL智能体,其推送通知的行为影响显著高于上下文无关的智能体。
  • 在驾驶辅助案例研究中,预训练的RL智能体成功基于模拟的驾驶员分心状态识别出最优干预时机,同时保持了驾驶员的自主权。
  • 使用模拟数据进行预训练显著减少了实现策略收敛所需的现实用户交互次数,有效缓解了冷启动问题。
  • 认知模型的使用使得可估计不可观测的认知状态(如决策阈值、认知偏差),并将其整合进RL奖励函数中。
  • 该方法在两个不同的HCI领域——行为健康与智能交通——中均展现出可行性,显示出广泛的应用潜力。
  • 经验验证的认知模型提升了模拟数据的可靠性,降低了因模型不准确导致策略失效的风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。