[论文解读] Learning to Read Braille: Bridging the Tactile Reality Gap with Diffusion Models
本文使用条件扩散模型从模拟深度渲染逼真的触觉图像,实现使用 DIGIT 传感器的零样本盲文阅读,在真实数据上达到 75.74% 的准确率。
Simulating vision-based tactile sensors enables learning models for contact-rich tasks when collecting real world data at scale can be prohibitive. However, modeling the optical response of the gel deformation as well as incorporating the dynamics of the contact makes sim2real challenging. Prior works have explored data augmentation, fine-tuning, or learning generative models to reduce the sim2real gap. In this work, we present the first method to leverage probabilistic diffusion models for capturing complex illumination changes from gel deformations. Our tactile diffusion model is able to generate realistic tactile images from simulated contact depth bridging the reality gap for vision-based tactile sensing. On real braille reading task with a DIGIT sensor, a classifier trained with our diffusion model achieves 75.74% accuracy outperforming classifiers trained with simulation and other approaches. Project page: https://github.com/carolinahiguera/Tactile-Diffusion
研究动机与目标
- 推动对基于视觉的触觉数据进行真实感渲染,以缩小仿真与现实之间的差距。
- 开发一个以模拟高度图为条件的触觉扩散模型,用以生成逼真的触觉图像。
- 在基于扩散渲染之后,演示使用 DIGIT 传感器进行真实盲文阅读的零样本转移。
- 在下游盲文分类任务中量化相对于仅仿真、数据增强和基于 GAN 的基线的改进。
提出的方法
- 将图像到图像翻译表述为条件扩散过程 p(y|x),其中 x 为模拟深度图,y 为近似真实的触觉图像。
- 使用带有去噪得分匹配目标的条件 U-Net 解码器来从带噪的 yT 在 x 条件下恢复 y0(Eq. 3)。
- 在 YCB-Slide 数据集的 180k 对 sim-depth / real tactile 图像对上预训练扩散模型。
- 使用 20% 的真实盲文字数据对模型进行微调,以适应该任务的纹理和盲文凸块。
- 推理阶段,从高斯噪声开始,迭代去噪,基于模拟深度输入进行条件化,以生成逼真的触觉图像(Eq. 4–6)。
- 使用 SSIM 和 MSE 对比真实触觉图像进行评估,并比较下游盲文分类的性能。
实验结果
研究问题
- RQ1基于扩散的渲染器是否能够捕捉光照和凝胶变形等在基于视觉的触觉传感器中的效果,以缩小仿真与现实之间的差距?
- RQ2在主要基于仿真数据进行训练时,基于扩散的后处理是否能够实现 DIGIT 传感器的零样本盲文读取转移?
- RQ3触觉扩散与基于 GAN 的方法在真实感和下游任务准确性方面有何比较?
- RQ4对下游盲文分类性能,使用有限真实数据进行微调的影响是多少?
主要发现
- 触觉扩散在测试轨迹上通常实现 SSIM 大于 0.80,表明真实触觉图像的结构特征较为逼真。
- 对 27 个盲文字字符进行微调的触觉扩散获得 SSIM 0.908 和 MSE 36.02(每通道最大 255),优于 cGAN(SSIM 0.879,MSE 47.99)。
- 用扩散生成数据训练的盲文分类器在真实数据上实现零样本准确率 75.74%。
- 仅仿真训练并结合数据增强或使用真实数据微调可以提高准确率,但基于扩散的方法需要更少的真实数据就能达到强性能。
- 基于扩散的渲染在保留盲文凹陷方面优于 cGAN,减少了因纹理伪影造成的误分类。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。