[论文解读] MUTEX: Learning Unified Policies from Multimodal Task Specifications
Mutex 提出了一种基于 Transformer 的统一策略网络,通过两阶段训练过程,利用掩码建模和跨模态匹配,从多模态任务规范(文本、语音、图像和视频)中进行学习。它在仿真和真实世界设置中,对所有六种模态类型(例如,文本指令、视频演示)均实现了最先进性能,通过利用互补的跨模态信号,超越了针对特定模态设计的基线模型。
Humans use different modalities, such as speech, text, images, videos, etc., to communicate their intent and goals with teammates. For robots to become better assistants, we aim to endow them with the ability to follow instructions and understand tasks specified by their human partners. Most robotic policy learning methods have focused on one single modality of task specification while ignoring the rich cross-modal information. We present MUTEX, a unified approach to policy learning from multimodal task specifications. It trains a transformer-based architecture to facilitate cross-modal reasoning, combining masked modeling and cross-modal matching objectives in a two-stage training procedure. After training, MUTEX can follow a task specification in any of the six learned modalities (video demonstrations, goal images, text goal descriptions, text instructions, speech goal descriptions, and speech instructions) or a combination of them. We systematically evaluate the benefits of MUTEX in a newly designed dataset with 100 tasks in simulation and 50 tasks in the real world, annotated with multiple instances of task specifications in different modalities, and observe improved performance over methods trained specifically for any single modality. More information at https://ut-austin-rpl.github.io/MUTEX/
研究动机与目标
- 开发一种统一的机器人策略,能够无需为每种模态单独设计模型,即可在多种模态(文本、语音、图像、视频)的任务规范下运行。
- 解决现有方法中各模态(如语言、视频、语音)被孤立处理的局限性。
- 通过联合训练多种模态,提升零样本泛化能力和鲁棒性,使策略能够泛化到未见过的模态组合。
- 利用跨模态监督——尤其是来自丰富视频演示的监督——来增强文本和语音等稀疏模态的表征。
- 设计一种可扩展的架构,能够处理可变长度的多模态输入,并同时预测动作和掩码信号。
提出的方法
- 使用类似 Perceiver 的编码器,通过交叉注意力机制关注可变长度的多模态任务规范(如文本、语音、图像、视频),同时以固定长度的机器人观测历史作为条件。
- 采用两阶段训练流程:第一阶段,在混合模态上通过掩码建模和行为克隆预训练策略;第二阶段,通过跨模态匹配进行微调,以对齐不同模态之间的表征。
- 对每种模态分别应用掩码建模目标:视觉模态(视频、图像目标)使用 L1 损失,文本和语音模态使用交叉熵损失。
- 引入跨模态匹配损失,将某一模态(如文本指令)的表征与信息更丰富的视频演示表征对齐。
- 使用模态特定的投影头(如文本、语音、视频),在第二阶段微调这些投影头,同时保持主策略权重冻结。
- 利用 CLIP 获取文本和图像嵌入,使用 Whisper 获取语音嵌入,同时对视觉输入使用 R3M 特征,确保强大的预训练表征。

实验结果
研究问题
- RQ1是否可以训练一个单一的统一策略,使其在无需为每种模态单独设计模型的前提下,泛化到多种任务规范模态(文本、语音、图像、视频)?
- RQ2与为每种模态单独训练模型相比,联合学习多种模态是否能提升性能?
- RQ3跨模态匹配——特别是将稀疏模态与丰富的视频演示对齐——在多大程度上能提升策略的泛化能力和鲁棒性?
- RQ4当输入为多种模态的组合,包括被掩码或不完整的规范时,模型表现如何?
- RQ5所提出的两阶段训练流程(掩码建模 + 跨模态匹配)是否能带来比单目标训练更好的表征学习和下游策略性能?
主要发现
- 在仿真和真实世界环境中,Mutex 在所有六种任务规范模态(文本目标、文本指令、图像目标、视频演示、语音目标、语音指令)上均优于所有针对特定模态的基线模型。
- 在仿真环境中,Mutex 在视频演示上的成功率为 66%,在图像目标上的成功率为 61%,尽管是单一统一模型,仍超越了最佳的模态特定基线(如视频为 67%,图像目标为 62%)。
- 在真实世界任务中,Mutex 在视频演示上的成功率为 50%,在文本指令上的成功率为 46%,在所有模态中均超过最佳的模态特定基线(如文本指令为 47%)。
- 消融实验表明,若移除掩码建模或跨模态匹配,性能均出现显著下降,证实了两阶段训练过程中这两个组件的重要性。
- 该模型能有效泛化到未见过的模态组合,展现出在模态类型之间强大的零样本迁移能力。
- 模型规模消融实验表明,性能提升源于多模态训练,而非模型容量,因为 Mutex 在所有三种测试规模(S、M、L)下均持续优于表现最佳的模态特定模型。
![Figure 2: Mutex ’s Model Architecture and Training Losses . Task specifications in each modality are encoded with pretrained modality-specific encoders, CLIP, and Whisper models [ 15 , 57 ] . During the first stage of training, one or more of these modalities are randomly selected and masked before](https://ar5iv.labs.arxiv.org/html/2309.14320/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。