Skip to main content
QUICK REVIEW

[论文解读] Multimodal Interaction with Multiple Co-located Drones in Search and Rescue Missions

Jonathan Cacace, Alberto Finzi|arXiv (Cornell University)|May 24, 2016
Speech and dialogue systems参考文献 12被引用 21
一句话总结

本文提出了一种多模态、混合主动性的人机交互框架,使忙碌的救援人员能够通过手势、语音和触控板输入,在高山搜救任务中协作控制多个共位无人机。该系统将实时手势与语音指令与无人机自主行为相结合,实现在时间压力下的高效、自然交互;结果显示,三架无人机在搜寻受困者速度和成功率方面显著优于两架,平均找到5.6名受困者,定位前三位受困者平均耗时96.6秒。

ABSTRACT

We present a multimodal interaction framework suitable for a human rescuer that operates in proximity with a set of co-located drones during search missions. This work is framed in the context of the SHERPA project whose goal is to develop a mixed ground and aerial robotic platform to support search and rescue activities in a real-world alpine scenario. Differently from typical human-drone interaction settings, here the operator is not fully dedicated to the drones, but involved in search and rescue tasks, hence only able to provide sparse, incomplete, although high-value, instructions to the robots. This operative scenario requires a human-interaction framework that supports multimodal communication along with an effective and natural mixed-initiative interaction between the human and the robots. In this work, we illustrate the domain and the proposed multimodal interaction framework discussing the system at work in a simulated case study.

研究动机与目标

  • 解决在高压力、时间受限的高山搜救(SAR)任务中,操作员无法完全专注于无人机控制的挑战。
  • 设计一种自然的多模态交互框架,支持忙碌救援人员通过手势、语音和触控板命令进行稀疏但高价值的输入。
  • 支持灵活的控制模式——自主、混合主动性与遥控,实现根据操作员意图的无缝切换。
  • 在模拟高山搜救场景中评估交互框架的有效性,涉及多架无人机。
  • 平衡操作员工作负荷,并确保在搜救过程中多架无人机之间的有效协同。

提出的方法

  • 系统采用多模态交互架构,结合肌动传感器(Myo臂环)实现手势识别、语音指令以及基于触控板的用户界面,用于人机通信。
  • 支持基于命令和摇杆的交互隐喻,允许在执行过程中进行精确控制和轨迹调整。
  • 通过将语音(例如“去那里”)与指向手势同步,实现指代性通信,以引导无人机动作。
  • 混合主动性控制回路持续将解析后的人类输入整合到机器人控制系统中,实时调整无人机行为。
  • 在模拟高山环境中对2–3架无人机进行评估,使用触控板界面进行监控和指令发布。
  • 记录并分析交互模态与控制模式,以评估工作负荷分配、指令使用情况及系统性能。

实验结果

研究问题

  • RQ1多模态交互框架如何在高风险搜救任务中,支持忙碌救援人员与多架共位无人机之间高效、自然且稳健的通信?
  • RQ2在时间受限场景中,结合手势与语音输入在多大程度上提升了无人机控制的效率与直观性?
  • RQ3在管理多架无人机时,操作员的工作负荷如何分配?该系统是否支持均衡、非低效的监控与控制?
  • RQ4使用三架无人机与两架无人机相比,对受困者搜寻速度和成功率有何性能影响?
  • RQ5不同的控制模式(自主、混合主动性、遥控)在任务成效与操作员参与度方面分别有何贡献?

主要发现

  • 使用三架无人机相比两架显著提升了受困者搜寻表现,平均找到5.6名受困者,而两架仅找到3.9名(p < .0001)。
  • 定位前三位受困者平均耗时96.6秒(三架),而两架为249.6秒(p < .0001)。
  • 手势指令被频繁使用,尤其与语音结合时;纯语音指令使用较少,表明多模态协同效应明显。
  • 系统实现了操作员注意力的均衡分配,平均有108秒(占总时间的30%)用于监控最活跃的无人机,同时有75.6秒(占总时间的22%)用于同步监控所有无人机。
  • 无人机主要以自主模式运行(占主导),仅极小部分时间处于遥控模式,表明系统有效依赖自主性,且直接控制需求极少。
  • 三架无人机成功找到全部六名受困者的比例为46.6%,而两架为0%,证明该多模态框架具备可扩展性与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。