Skip to main content
QUICK REVIEW

[论文解读] Gaze and Gestures in Telepresence: multimodality, embodiment, and roles of collaboration

Mauro Cherubini, Rodrigo Cardoso de Oliveira|arXiv (Cornell University)|Jan 18, 2010
Speech and dialogue systems参考文献 14被引用 5
一句话总结

本文通过先进的眼动追踪、手势识别和三维重建技术,开展了一项受控实验,研究注视意识与手势整合如何提升远程协作中人机交互的效率。通过在动态、具身化的条件下测试多模态通信,并支持灵活的角色分配,本研究旨在识别出能有效提升协作效率并降低认知负荷的最佳非语言线索组合。

ABSTRACT

This paper proposes a controlled experiment to further investigate the usefulness of gaze awareness and gesture recognition in the support of collaborative work at a distance. We propose to redesign experiments conducted several years ago with more recent technology that would: a) enable to better study of the integration of communication modalities, b) allow users to freely move while collaborating at a distance and c) avoid asymmetries of communication between collaborators.

研究动机与目标

  • 探究注视意识与手势识别如何通过支持自然、多模态通信来提升远程协作效果。
  • 克服以往远程呈现系统在移动性受限、沟通不对称或模态整合不佳方面的局限性。
  • 通过双环境中的具身化交互,实现在数字与物理工作空间之间的无缝切换。
  • 突破静态“助手-工作者”角色分工,支持协作过程中灵活、动态的角色分配。
  • 评估不同模态(未经中介、基于要点、自动)的注视与手势传输对协作表现的影响。

提出的方法

  • 设计一个包含双屏幕、共享工作区及多台摄像机用于三维重建与眼动追踪的受控实验环境。
  • 集成实时眼动追踪以监测注意力焦点,结合手势识别技术实现指示性指向与空间指代。
  • 实现三种非语言通信传输模式:未经中介(连续信号)、基于要点(事件触发)和自动(系统驱动)。
  • 采用因子设计实验,操控注视与手势的可用性、传输模式以及注意力焦点控制方式(手动、自动、半自动)。
  • 使用NASA TLX测量任务负荷与任务完成时间,以评估易用性与效率。
  • 利用现有系统(如透视校正视频会议)确保真实的眼部接触与空间感知。

实验结果

研究问题

  • RQ1注视意识与手势识别的整合如何影响远程协作中的任务完成时间?
  • RQ2未经中介、基于要点与自动传输方式在注视与手势信息上的相对影响,如何作用于协作效率与认知负荷?
  • RQ3不同的注意力焦点控制策略(手动、自动、半自动)如何影响用户表现与感知工作量?
  • RQ4注视与手势的多模态整合在何种程度上减少了远程协作问题解决过程中的误解?
  • RQ5在共享工作空间中动态、具身化地使用数字与物理工具,如何影响协作成果?

主要发现

  • 仅依靠注视意识可减少完成任务所需的对话轮次与词汇量,如Monk与Gale(2006)所证实,但该优势依赖于恰当的上下文传输。
  • 如Cherubini等人(2009)所展示,协作双方在共享工作区中注视焦点的空间分离越大,误解发生的概率越高。
  • 注视与手势的未经中介传输可能因信息过载而增加认知负荷,表明选择性或处理后的反馈更具有效性。
  • 基于要点或由系统处理的注视与手势传输(例如在指向等有意动作后触发)可在保持沟通清晰性的同时降低认知负荷。
  • 结合注视与手势模态能更有效地支持指示性指代与空间指代,尤其在涉及共享物理与数字工具的任务中。
  • 所提出的实验框架可在受控条件下系统比较多种多模态通信策略,为未来远程呈现系统的设计提供基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。