[论文解读] Towards Generating Virtual Movement from Textual Instructions A Case Study in Quality Assessment
本研究通过众包方式,调查了基于人类的虚拟运动质量评估,这些运动由文本运动指令生成。研究发现,RGB视频可视化在不同评估者之间的一致性最高(前进步态动作的kappa值为0.74),支持其作为自动化体感游戏与治疗应用中可靠运动质量评估的最优模态。
Many application areas ranging from serious games for health to learning by demonstration in robotics, could benefit from large body movement datasets extracted from textual instructions accompanied by images. The interpretation of instructions for the automatic generation of the corresponding motions (e.g. exercises) and the validation of these movements are difficult tasks. In this article we describe a first step towards achieving automated extraction. We have recorded five different exercises in random order with the help of seven amateur performers using a Kinect. During the recording, we found that the same exercise was interpreted differently by each human performer even though they were given identical textual instructions. We performed a quality assessment study based on that data using a crowdsourcing approach and tested the inter-rater agreement for different types of visualizations, where the RGBbased visualization showed the best agreement among the annotators.
研究动机与目标
- 探索人类计算作为评估从文本运动指令生成的人体动作质量的可行方法。
- 识别在众包环境中,人类评估者用于评估运动质量的最可靠可视化模态。
- 为从运动指令表自动生成虚拟运动的自动化流程奠定基础步骤,应用于治疗与游戏应用。
- 在质量评估任务中,评估不同运动可视化类型(RGB、深度图、骨骼数据、VR)之间的评分者一致性。
- 确定尽管对相同指令的人类理解存在差异,是否仍能实现一致的质量判断。
提出的方法
- 收集了包含约1000个运动描述的《身体运动指令表语料库》(PEISC),按身体姿势(如站立、端坐)分类。
- 使用Kinect记录了五种无需器械的运动,由七名业余表演者(3名男性,4名女性;M=25,SD=5)完成,每人重复十次。
- 从Kinect数据生成四种可视化类型:RGB(彩色视频)、深度图、骨骼数据和虚拟现实渲染图。
- 设计了众包调查,20名参与者通过逐轮淘汰最差表现并选出最佳表现的方式,评估不同可视化下的运动质量。
- 使用kappa统计量衡量不同可视化类型和运动之间的评分者一致性。
- 收集了人口统计信息及运动后的理解反馈,以评估指令清晰度与表现差异性。
实验结果
研究问题
- RQ1人类计算能否可靠地评估从文本运动指令生成的人体动作质量?
- RQ2在质量评估任务中,哪种运动可视化模态(RGB、深度图、骨骼数据、VR)能实现最高的评分者一致性?
- RQ3当评估由不同个体执行的相同运动时,人类对运动质量的判断有多一致?
- RQ4文本指令的清晰度在多大程度上影响运动执行的变异性与质量评估的差异?
- RQ5众包质量评估能否作为从文本到虚拟运动生成自动化流程的可靠中间步骤?
主要发现
- RGB视频可视化在前进步态动作中实现了最高的评分者一致性,kappa统计量为0.74,表明标注者之间存在显著一致性。
- 评分者一致性在不同运动中有所差异,前进步态动作的kappa值最高(0.74),而深蹲动作最低(0.51),表明可靠性为中等到显著。
- 尽管指令完全相同,表演者对同一运动的理解存在显著差异,表明运动执行存在明显的人际差异。
- 指令理解不一致——部分参与者认为说明表难以理解,而另一些人则认为容易理解,表明指令清晰度存在差异。
- 本研究证实,即使对人类而言,运动质量评估仍具挑战性,评分者一致性为中等到显著,具体取决于运动类型和可视化类型。
- RGB视频被视作最直观且最可靠的评估模态,可能因其熟悉度高且能自然呈现运动过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。