[论文解读] Task-relevant Representation Learning for Networked Robotic Perception
该论文提出了一种协同设计框架,通过将编码器/解码器网络与预训练的固定任务网络对齐,学习机器人传感数据的任务相关且最小化的表示。通过利用任务目标引导压缩,该方法在保持多种任务(如火星地形分类、神经运动规划和环境异常检测)高精度的前提下,相比基线自编码器实现了高达11倍的压缩率,即使在低功耗边缘加速器上也能保持高效性能。
Today, even the most compute-and-power constrained robots can measure complex, high data-rate video and LIDAR sensory streams. Often, such robots, ranging from low-power drones to space and subterranean rovers, need to transmit high-bitrate sensory data to a remote compute server if they are uncertain or cannot scalably run complex perception or mapping tasks locally. However, today's representations for sensory data are mostly designed for human, not robotic, perception and thus often waste precious compute or wireless network resources to transmit unimportant parts of a scene that are unnecessary for a high-level robotic task. This paper presents an algorithm to learn task-relevant representations of sensory data that are co-designed with a pre-trained robotic perception model's ultimate objective. Our algorithm aggressively compresses robotic sensory data by up to 11x more than competing methods. Further, it achieves high accuracy and robust generalization on diverse tasks including Mars terrain classification with low-power deep learning accelerators, neural motion planning, and environmental timeseries classification.
研究动机与目标
- 为解决当前传感数据表示的低效问题,这些表示原本是为人类感知优化而非机器人任务性能设计的。
- 降低资源受限的机器人在将数据传输至远程服务器执行感知任务时的通信和计算成本。
- 协同设计最小化、特定于任务的传感表示,仅保留与预训练任务模型目标相关的关键特征。
- 通过最小化本地计算和带宽使用,实现在低功耗边缘设备(如Google Edge TPU)上的高效部署。
- 在多种传感器模态上实现泛化,包括RGB-D视频、激光雷达点云和环境时间序列。
提出的方法
- 在中央服务器上固定一个可微分的预训练任务网络,其目标用于指导机器人端编码器和服务器端解码器的学习。
- 编码器将原始传感输入压缩为低维瓶颈表示 $ z $,而解码器则用于重建输入以进行任务推理。
- 损失函数结合了特定于任务的分类损失和重建损失,其中任务损失占主导地位,以优先保留与下游任务相关的信息。
- 该框架支持即插即用的任务模块,无需修改输入维度,可无缝集成公共模型。
- 该方法通过反向传播进行端到端训练,训练期间冻结任务网络参数。
- 计算可灵活分配于机器人和服务器之间,兼容低功耗深度神经网络加速器。
实验结果
研究问题
- RQ1协同设计的编码器-解码器框架能否学习到最小化且与任务相关的表示,从而在压缩效率上超越标准自编码器?
- RQ2所提出的方法在未见的机器人感知任务(如未见过的火星地形或环境传感器异常)上泛化能力如何?
- RQ3该方法在保持低功耗硬件上高任务准确率的前提下,能在多大程度上降低通信和本地计算成本?
- RQ4该框架能否在无需架构修改的情况下应用于多种传感器模态(包括视频、激光雷达和时间序列数据)?
- RQ5与以重建为中心的压缩相比,任务引导的压缩在鲁棒性和效率方面表现如何?
主要发现
- 该方法通过聚焦于与任务相关的特征而非完整重建,实现了相比标准自编码器高达11倍的压缩率。
- 在火星地形分类任务中,当瓶颈大小较小时($ z = 4, 8 $),TaskNet在性能上显著优于MPNet,表明其在未见地形上的泛化能力更强。
- 在神经运动规划任务中,TaskNet在 $ z = 8 $ 时仍保持高性能,而MPNet性能急剧下降,表明其具有更高的信息效率。
- 在环境时间序列异常检测任务中,TaskNet在保持90%测试准确率的同时,实现了低重建损失和高压缩率。
- 该框架可部署于低功耗边缘设备(如Google Edge TPU),适用于对计算和带宽有严格限制的真实机器人系统。
- 该方法在多种传感器模态(包括视频、激光雷达和多传感器时间序列)上均表现出泛化能力,且性能一致提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。