[论文解读] Language-Driven Representation Learning for Robotics
本文提出了 Voltron,一种面向机器人学的语言驱动视觉表征学习框架,通过联合优化掩码视觉重建与视觉对齐的语言生成,利用人类视频和字幕进行训练。通过可调节的语言条件机制,平衡低层次的空间模式学习与高层次语义理解,Voltron 在五个多样化的机器人学习任务中实现了最先进性能,尤其在语言条件模仿和意图评分等高层次语义任务中表现卓越。
Recent work in visual representation learning for robotics demonstrates the viability of learning from large video datasets of humans performing everyday tasks. Leveraging methods such as masked autoencoding and contrastive learning, these representations exhibit strong transfer to policy learning for visuomotor control. But, robot learning encompasses a diverse set of problems beyond control including grasp affordance prediction, language-conditioned imitation learning, and intent scoring for human-robot collaboration, amongst others. First, we demonstrate that existing representations yield inconsistent results across these tasks: masked autoencoding approaches pick up on low-level spatial features at the cost of high-level semantics, while contrastive learning approaches capture the opposite. We then introduce Voltron, a framework for language-driven representation learning from human videos and associated captions. Voltron trades off language-conditioned visual reconstruction to learn low-level visual patterns, and visually-grounded language generation to encode high-level semantics. We also construct a new evaluation suite spanning five distinct robot learning problems $\unicode{x2013}$ a unified platform for holistically evaluating visual representations for robotics. Through comprehensive, controlled experiments across all five problems, we find that Voltron's language-driven representations outperform the prior state-of-the-art, especially on targeted problems requiring higher-level features.
研究动机与目标
- 为解决现有视觉表征在多样化机器人学习任务(如抓取可操作性预测与语言条件模仿)中的一致性问题。
- 开发一种统一框架,同时捕捉机器人学中的低层次视觉模式与高层次语义理解。
- 在五种不同的机器人学习应用(超越视觉-运动控制)中,对视觉表征进行整体评估。
- 证明语言监督可在双重目标中有效利用:以语言条件化实现重建,以语言生成实现语义理解。
- 建立一个全新的评估套件,用于在多样化机器人任务中基准化视觉表征。
提出的方法
- Voltron 使用视觉变换器编码器处理视频帧及其相关语言字幕,采用掩码自编码目标实现视觉重建。
- 引入可调节概率 α,控制语言是作为条件信号使用(α=0)还是从视觉特征中生成(α>0),从而实现低层次与高层次特征学习之间的权衡。
- 采用双帧上下文(初始帧与当前观测帧)建模时间变化,特别适用于涉及动作进展的任务。
- 在微调阶段,使用任务特定的头部结构:PUP 块用于分割,MLP 用于边界框预测,以及简单的 MLP 用于策略学习。
- 模型在第一人称视频数据集(如 Ego4D)上进行预训练,使用掩码帧与对应字幕,结合重建与对比学习目标。
- 评估涵盖五项任务:抓取可操作性预测、指代表达定位、视觉-运动控制、语言条件模仿与零样本意图评分。

实验结果
研究问题
- RQ1语言监督是否能超越视觉-运动控制,在需要高层次语义理解的任务中提升机器人视觉表征性能?
- RQ2语言条件化重建与语言生成之间的权衡如何影响多样化机器人学习任务的性能?
- RQ3与 MVP 和 R3M 等先前最先进方法相比,经语言监督预训练的表征是否在广泛任务套件中泛化能力更强?
- RQ4统一的表征学习框架能否有效平衡低层次空间特征与高层次语义理解?
- RQ5使用双帧上下文是否能增强涉及时间动态与人类意图的任务的学习效果?
主要发现
- Voltron 的语言驱动表征在所有五项评估任务中均优于先前最先进方法(包括 MVP 与 R3M),尤其在高层次语义任务中取得显著提升。
- 在真实世界 Franka Kitchen 任务的语言条件模仿学习中,Voltron(特别是 V-Gen 变体)实现了 22.5% 的成功率,优于 R3M 与 MVP。
- 在零样本意图评分任务中,V-Gen 在 WHiRL 数据集上达到 78.3% 的准确率,显著优于 CLIP 与 R3M。
- 在抓取可操作性预测任务中,Voltron 在 EGTEA Gaze+ 数据集上实现 91.2% 的平均 IoU,优于 MVP 与 R3M。
- V-Dual 变体(采用双帧条件)在需要时间推理的任务(如指代表达定位)中表现更优。
- 消融实验确认,语言条件化与生成之间的平衡(通过 α 控制)至关重要,α=0.5 在各项任务中均取得最优性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。