Skip to main content
QUICK REVIEW

[论文解读] Multisensory Learning Framework for Robot Drumming

Andrey Barsky, Claudio Zito|arXiv (Cornell University)|Jul 23, 2019
Robot Manipulation and Learning参考文献 4被引用 4
一句话总结

本文提出了一种开源框架,用于在仿真中生成同步的多模态数据(音频、视频、本体感觉),以训练人形机器人进行打鼓。通过使用带有LSTM和模态丢弃的对比自编码器,系统学习非线性感觉运动映射,实现精确的跨模态检索——例如,从未见过的音频或视频输入生成新颖的打鼓动作,通过定性重建保真度和对未见序列的泛化能力得到验证。

ABSTRACT

The hype about sensorimotor learning is currently reaching high fever, thanks to the latest advancement in deep learning. In this paper, we present an open-source framework for collecting large-scale, time-synchronised synthetic data from highly disparate sensory modalities, such as audio, video, and proprioception, for learning robot manipulation tasks. We demonstrate the learning of non-linear sensorimotor mappings for a humanoid drumming robot that generates novel motion sequences from desired audio data using cross-modal correspondences. We evaluate our system through the quality of its cross-modal retrieval, for generating suitable motion sequences to match desired unseen audio or video sequences.

研究动机与目标

  • 开发一种可扩展的开源仿真框架,用于在音频、视频和本体感觉模态之间收集大规模、时间同步的多模态数据。
  • 学习非线性感觉运动映射,使机器人能够根据期望的音频或视觉输入生成适当的打鼓动作。
  • 通过鲁棒的跨模态重建实现模态不变性,即使输入模态部分缺失也能保持性能。
  • 通过学习因果感觉运动对应关系,实现对未见音频和视频序列的泛化能力。
  • 为未来在机器人操作任务中集成触觉反馈奠定基础。

提出的方法

  • 该框架使用Gazebo和ROS模拟Baxter机器人执行打鼓任务,实现音频、视频和关节状态模态的同步数据采集。
  • 运动基元被定义为三路点轨迹(起始点、接触点、返回点),并通过运动规划器与节拍谱输入同步。
  • 音频通过机器人末端执行器与鼓面之间的碰撞检测生成;视频则通过虚拟头戴摄像头捕捉。
  • 多模态感觉整合网络分别编码单模态特征(图像、音频、关节角度),将其拼接后输入瓶颈层为LSTM的对比自编码器。
  • 训练期间,随机丢弃模态以增强鲁棒性和模态不变性,重建损失计算为所有三个模态的均方误差。
  • 系统训练目标是从部分输入重建完整的感官数据,从而支持跨模态检索和对未见序列的泛化能力。

实验结果

研究问题

  • RQ1仿真框架能否高效生成用于机器人操作任务的大规模、同步多模态数据?
  • RQ2深度感觉运动网络能否学习音频、视觉与运动模态之间的非线性映射,从而实现跨模态检索?
  • RQ3训练期间的模态丢弃是否能产生鲁棒且不变的表示,从而在输入模态缺失时仍支持泛化?
  • RQ4系统能否从未见过的音频或视频序列中生成新颖且合适的打鼓动作?
  • RQ5网络在保留关键信号特征(如鼓点和运动轨迹)的同时,能否有效重建缺失的感官模态?

主要发现

  • 系统能够从未见的音频和视频输入成功生成动作序列,表明其泛化能力超越了训练数据。
  • 音频重建保留了鼓点信号,同时过滤掉背景噪声,表明信号恢复有效。
  • 视觉重建在定性上与真实情况匹配,能准确跟随随时间变化的运动轨迹。
  • 从音频重建的动作存在噪声,这是由于高阶时间依赖性导致的建模局限,提示在运动预判建模方面存在不足。
  • 训练期间使用模态丢弃可实现鲁棒重建,并支持模态不变表示。
  • 该框架具有可扩展性,支持未来集成触觉反馈以增强操作能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。