[论文解读] Learning to Engage with Interactive Systems: A Field Study on Deep Reinforcement Learning in a Public Museum
本文提出了一种深度强化学习(DRL)框架,通过红外传感器数据估算群体互动中的人类参与度——同时结合主动手势与被动占用状态——并将此参与度估计作为奖励信号,用于训练大型互动雕塑系统(Living Architecture)在公共博物馆中的自适应、类人行为。该方法在参与度和感知亲和力方面均优于预编程行为,证明了在开放世界、动态环境中实现自主、社会适应性系统的技术可行性。
Physical agents that can autonomously generate engaging, life-like behaviour will lead to more responsive and interesting robots and other autonomous systems. Although many advances have been made for one-to-one interactions in well controlled settings, future physical agents should be capable of interacting with humans in natural settings, including group interaction. In order to generate engaging behaviours, the autonomous system must first be able to estimate its human partners' engagement level. In this paper, we propose an approach for estimating engagement during group interaction by simultaneously taking into account active and passive interaction, i.e. occupancy, and use the measure as the reward signal within a reinforcement learning framework to learn engaging interactive behaviours. The proposed approach is implemented in an interactive sculptural system in a museum setting. We compare the learning system to a baseline using pre-scripted interactive behaviours. Analysis based on sensory data and survey data shows that adaptable behaviours within an expert-designed action space can achieve higher engagement and likeability.
研究动机与目标
- 开发一种能够在非结构化、公共环境中实现长期、自适应交互的自主系统。
- 通过结合主动手势(如挥手)和被动占用(靠近区域内的存在)来估算群体互动中的参与度。
- 使用深度强化学习,以参与度作为学习到的奖励信号来训练互动行为,实现持续适应。
- 评估所学习的行为在真实博物馆环境中是否在参与度和亲和力方面优于预编程行为。
- 探索利用隐式人类反馈(通过传感器数据)训练互动系统,而无需显式人类监督的可行性。
提出的方法
- 系统使用多个红外(IR)传感器检测人类的主动手势(如挥手)和被动占用(处于互动区域内的存在)。
- 参与度被估计为结合主动交互频率与被动占用持续时间的复合奖励信号,建模为连续的实时反馈信号。
- 采用深度确定性策略梯度(DDPG)算法训练策略网络,实现对雕塑系统执行器的连续动作空间控制。
- 奖励函数设计用于最大化持续参与度,平衡新颖性与响应性,避免过度刺激。
- 仅使用简化的模拟器进行初始超参数调优和代码验证,而非用于预训练。
- 系统部署于真实的博物馆装置中(如Radiant Soil),通过长时间的现场访客流互动进行学习。
实验结果
研究问题
- RQ1强化学习智能体能否在真实世界、开放世界、群体互动环境中,利用隐式参与度信号学习生成具有吸引力的行为?
- RQ2在公共博物馆背景下,基于学习的行为生成是否相比预编程行为具有更高的感知参与度和亲和力?
- RQ3在群体环境中,被动占用与主动手势如何共同作用,以形成可靠的参与度估计信号?
- RQ4DRL智能体在面对多样化、非结构化的互动模式时,能在多大程度上实现行为的长期自适应?
- RQ5在具有高自由度的大规模真实世界互动系统中部署DRL时,面临哪些实际挑战?
主要发现
- 通过反映交互频率和持续时间的传感器数据测量,所学习的策略(PLA)在平均参与度水平上显著高于预编程行为(PB)基线。
- 调查数据显示,参观者认为所学习的系统比预编程版本更具亲和力和吸引力,表明其社会接受度更高。
- 该系统成功适应了多样的互动风格,包括群体动态、社会影响(如模仿)以及访客专业水平的差异。
- 将主动手势与被动占用相结合的复合参与度信号,有效引导RL智能体生成社会适宜、响应及时的行为。
- 尽管在样本效率方面存在挑战且缺乏真实模拟器,DDPG方法在真实博物馆环境中的长期部署中仍表现出稳定的训练性能。
- 结果表明,隐式、基于参与度的奖励设计在开放世界环境中训练自主、自适应互动系统方面具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。