Skip to main content
QUICK REVIEW

[论文解读] MidasTouch: Monte-Carlo inference over distributions across sliding touch

Sudharshan Suresh, Zilin Si|arXiv (Cornell University)|Oct 25, 2022
Tactile and Sensory Interactions被引用 6
一句话总结

MidasTouch 是一种触觉感知系统,通过蒙特卡洛粒子滤波器实现基于视觉的触觉传感器在已知物体表面滑动时的在线全局定位。它利用从仿真数据中学习到的触觉编码嵌入,将局部表面几何形状与预计算的编码本进行比较,在无视觉先验条件下,实现在真实滑动任务中亚2厘米和亚11度的位姿误差。

ABSTRACT

We present MidasTouch, a tactile perception system for online global localization of a vision-based touch sensor sliding on an object surface. This framework takes in posed tactile images over time, and outputs an evolving distribution of sensor pose on the object's surface, without the need for visual priors. Our key insight is to estimate local surface geometry with tactile sensing, learn a compact representation for it, and disambiguate these signals over a long time horizon. The backbone of MidasTouch is a Monte-Carlo particle filter, with a measurement model based on a tactile code network learned from tactile simulation. This network, inspired by LIDAR place recognition, compactly summarizes local surface geometries. These generated codes are efficiently compared against a precomputed tactile codebook per-object, to update the pose distribution. We further release the YCB-Slide dataset of real-world and simulated forceful sliding interactions between a vision-based tactile sensor and standard YCB objects. While single-touch localization can be inherently ambiguous, we can quickly localize our sensor by traversing salient surface geometries. Project page: https://suddhu.github.io/midastouch-tactile/

研究动机与目标

  • 解决在无视觉先验条件下,基于视觉的触觉传感器在已知物体表面滑动交互过程中的全局定位挑战。
  • 通过在长时间序列内整合局部几何特征,克服单次触觉观测的模糊性。
  • 利用适配于三维物体表面流形的粒子滤波器框架,实现鲁棒的非参数位姿估计。
  • 提供一种可扩展且泛化能力强的方法,适用于涉及复杂组合几何形状的家用及机器人操作任务。
  • 发布一个基准数据集(YCB-Slide),以支持触觉定位的评估及未来研究。

提出的方法

  • 采用非参数蒙特卡洛粒子滤波器,在时间上持续维护并更新传感器在物体表面的位姿分布。
  • 使用在仿真触觉图像上训练的触觉编码网络,生成紧凑且具有区分性的局部表面几何嵌入。
  • 将这些嵌入与预计算的、与物体相关的触觉编码本进行比较,以计算位姿更新的似然度。
  • 利用基于视觉的触觉传感器(例如 DIGIT)捕获具有亚毫米级空间分辨率的高分辨率高度图。
  • 采用受激光雷达场景识别启发的对比学习目标训练触觉编码网络,实现鲁棒的局部特征匹配。
  • 按顺序整合带有位姿的触觉图像,以优化位姿分布,基于触觉相似性得分进行粒子重采样。

实验结果

研究问题

  • RQ1粒子滤波器框架是否能仅依靠触觉反馈有效实现滑动触觉传感器的在线全局定位?
  • RQ2通过时间整合,学习到的触觉嵌入在多大程度上能消除单次触觉观测的模糊性?
  • RQ3接触面积和穿刺深度在多大程度上影响基于触觉的位姿估计精度?
  • RQ4在未微调的情况下,仿真训练的触觉编码网络是否能泛化到真实世界的滑动交互?
  • RQ5该系统在具有不同几何复杂度的多样化 YCB 物体上的性能如何扩展?

主要发现

  • 在模拟环境中,MidasTouch 的中位位姿误差为 0.28 厘米和 2.03°;在真实世界实验中,对 YCB 物体的中位误差为 1.11 厘米和 10.76°。
  • 即使初始位姿与真实位置相距甚远,系统也能在数秒滑动内收敛到正确的位姿分布。
  • 更大的接触面积(通过更深的穿刺实现)显著降低了跟踪误差,接触面积与最终误差之间存在明显的反比关系。
  • 由于有效整合了局部几何信息,该方法在准确性和鲁棒性方面优于基线方法,尤其在缺乏视觉先验时表现更优。
  • 在小型物体(如 cotter_pin、steel_nail)上,系统实现了低于 5 毫米和 5° 的误差,且轨迹长度仅为大型 YCB 物体的 1/10,粒子数量减少至 1/5。
  • YCB-Slide 数据集包含真实和仿真滑动交互数据,支持可复现的基准测试,并证明了该方法在多样化物体形状上的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。