[论文解读] Coordinated Heterogeneous Distributed Perception based on Latent Space Representation
本文提出了一种协调的异构多机器人系统,利用联合多模态变分自编码器(JMVAE)在相机与LiDAR数据之间建立共享潜在空间,实现双向传感器信息交换。在该潜在空间中训练深度Q网络(DQN),通过引导机器人前往最优兴趣点(PoI)以最小化不确定性,从而在检测精度上优于朴素探索策略。
We investigate a reinforcement approach for distributed sensing based on the latent space derived from multi-modal deep generative models. Our contribution provides insights to the following benefits: Detections can be exchanged effectively between robots equipped with uni-modal sensors due to a shared latent representation of information that is trained by a Variational Auto Encoder (VAE). Sensor-fusion can be applied asynchronously due to the generative feature of the VAE. Deep Q-Networks (DQNs) are trained to minimize uncertainty in latent space by coordinating robots to a Point-of-Interest (PoI) where their sensor modality can provide beneficial information about the PoI. Additionally, we show that the decrease in uncertainty can be defined as the direct reward signal for training the DQN.
研究动机与目标
- 通过共享潜在空间表示,实现不同传感器模态(如相机与LiDAR)之间机器人的有效信息交换。
- 通过利用在多模态数据上训练的变分自编码器(VAE)的生成能力,支持异步传感器融合。
- 通过在潜在空间中训练深度Q网络(DQN),以基于不确定性减少的方式,实现异构机器人去中心化的协调。
- 将不确定性减少直接定义为DQN训练的形状奖励信号,从而实现高效探索与主动感知。
- 证明由联合多模态VAE生成的潜在空间表示可提升多机器人感知任务中的分类性能与协作效率。
提出的方法
- 训练联合多模态变分自编码器(JMVAE),将相机与LiDAR数据编码为具有 $ D_z = 2 $ 个维度的共享解耦潜在空间,使用高斯先验和变分推断。
- JMVAE采用独立的单模态编码器 $ q_{ heta_x}(z|x) $ 和 $ q_{ heta_w}(z|w) $,以及双模态解码器 $ p_{ heta}(x,w|z) $,通过最小化变分信息(VI)损失,使模态在潜在空间中对齐。
- 特征提取器 $ f_x $ 和 $ f_w $ 将原始传感器数据预处理为固定维度的向量 $ D_x = D_w $,降低维度并稳定VAE训练。
- 在潜在状态 $ z_n = (\mu_{1,n}, \sigma_{1,n}, \dots, \mu_{D_z,n}, \sigma_{D_z,n}) $ 上训练深度Q网络(DQN),使用潜在方差的L2范数倒数 $ I_n = 1 / \|\sigma_n\|_2 $ 作为不确定性代理。
- DQN接收形状奖励:若信息增加则 $ r = \Delta I_n $,若无改进则 $ r = -1 $,若为无操作动作则 $ r = 0 $,直接优化不确定性减少目标。
- 使用 $ \gamma = 0.95 $ 的DQN算法训练DQN策略,采用 $ \epsilon $-贪婪探索($ \epsilon_{\text{start}} = 1.0 $,$ \epsilon_{\text{min}} = 0.01 $,衰减率 = 0.99),并使用Adam优化($ \alpha = 0.001 $)
实验结果
研究问题
- RQ1共享潜在空间表示是否能实现异构传感器机器人之间的有效跨模态感知与信息交换?
- RQ2多模态VAE的生成能力是否能支持分布式机器人系统中的异步传感器融合?
- RQ3潜在空间中的不确定性是否可有效用作DQN训练的奖励信号,以实现协调机器人探索?
- RQ4在潜在空间中训练DQN是否能相比朴素探索策略,实现更优的检测性能与更短的探索时间?
- RQ5当单个模态无法区分物体类别时,联合多模态VAE如何处理模糊分类?
主要发现
- JMVAE成功学习到联合潜在表示,可实现缺失模态的双向生成(例如,从LiDAR输入重建图像特征,反之亦然)。
- 在单模态情况下,模糊类别在潜在空间中坍缩为其均值,但多模态输入保留了类别分离,且不同方差反映了不确定性。
- 在潜在空间中训练的DQN展现出稳定的学习曲线,平均总奖励在2000个训练周期内持续上升,表明策略学习有效。
- 基于不确定性减少($ \Delta I_n $)的形状奖励能有效引导DQN选择信息丰富的PoI,优于随机或非自适应探索。
- 该系统表明,由多模态VAE生成的潜在空间表示可显著提升异构机器人团队中的物体分类准确率。
- 在VAE输入前使用特征提取器 $ f_x $ 和 $ f_w $ 稳定了训练过程,并防止了深层架构中的权重坍缩,尤其在模态维度不平衡时效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。