Skip to main content
QUICK REVIEW

[论文解读] CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection

Guankun Wang, Han Xiao|arXiv (Cornell University)|Oct 10, 2024
Gastric Cancer Management and Outcomes被引用 5
一句话总结

CoPESD 引入一个细粒度、多层次的手术运动数据集用于 内镜下粘膜下剥离术(ESD),并证明在 CoPESD 上训练的 LVLMs 可以预测低级别的机器人运动,作为 ESD 的副驾驶。

ABSTRACT

submucosal dissection (ESD) enables rapid resection of large lesions, minimizing recurrence rates and improving long-term overall survival. Despite these advantages, ESD is technically challenging and carries high risks of complications, necessitating skilled surgeons and precise instruments. Recent advancements in Large Visual-Language Models (LVLMs) offer promising decision support and predictive planning capabilities for robotic systems, which can augment the accuracy of ESD and reduce procedural risks. However, existing datasets for multi-level fine-grained ESD surgical motion understanding are scarce and lack detailed annotations. In this paper, we design a hierarchical decomposition of ESD motion granularity and introduce a multi-level surgical motion dataset (CoPESD) for training LVLMs as the robotic extbf{Co}- extbf{P}ilot of extbf{E}ndoscopic extbf{S}ubmucosal extbf{D}issection. CoPESD includes 17,679 images with 32,699 bounding boxes and 88,395 multi-level motions, from over 35 hours of ESD videos for both robot-assisted and conventional surgeries. CoPESD enables granular analysis of ESD motions, focusing on the complex task of submucosal dissection. Extensive experiments on the LVLMs demonstrate the effectiveness of CoPESD in training LVLMs to predict following surgical robotic motions. As the first multimodal ESD motion dataset, CoPESD supports advanced research in ESD instruction-following and surgical automation. The dataset is available at \href{https://github.com/gkw0010/CoPESD}{https://github.com/gkw0010/CoPESD.}}

研究动机与目标

  • 提供对 ESD 动作的粒度化、分层分解,以实现部分自动化和 LVLM 基于协同驾驶。
  • 创建一个公开可访问的多模态数据集(图像 + 边界框 + 多层次运动),来自机器人辅助手术和常规 ESD。
  • 证明对 LVLMs 进行微调后,能够遵循手术指令并预测低级别的机器人运动以支持 ESD。
  • 建立基准和评估协议,以评估 LVLM 在手术自动化中的指令跟随、定位与运动方向准确性。

提出的方法

  • 为 ESD 提出分层的运动粒度:操作、任务、 surgeme、运动原语,以及导航运动原语。
  • 收集并处理 40 段 ESD 视频(机器人辅助和常规)以产生 17,679 张图像、32,699 个边界框和 88,395 个多层次运动。
  • 用多层次运动对图像进行标注;通过两名内镜医生的交叉核对和质量控制验证标注;使用 ChatGPT 生成每个动作五种不同表述版本来扩充文本变体。
  • 用 LLaMA-2 主干的 SPHINX-X 和 LLaVA-1.5 对 CoPESD 进行微调;用基于 GPT 的响应打分、定位(mIoU)和运动方向准确性/ F1 分数进行评估。
  • 对图像分辨率和数据比例进行消融评估,以评估对指令跟随和运动预测的影响。

实验结果

研究问题

  • RQ1一个多层次的 ESD 动作数据集是否能够让 LVLMs 通过视觉输入和文本提示预测低级别的机器人运动,从而充当副驾驶?
  • RQ2图像分辨率和训练数据大小对 LVLMs 的跟随 ESD 指令与本地化器具能力有何影响?
  • RQ3不同的 LVLM 主干和数据集规模如何影响语法感知的运动指令生成与 ESD 中的定位准确性?
  • RQ4CoPESD 是否在机器人辅助和常规 ESD 场景中都能支持鲁棒的指令跟随和运动预测?

主要发现

  • 在 CoPESD 上微调的 LVLMs 取得比基线更高的 GPT 基于响应质量和更强的工具定位能力。
  • 更高的输入图像分辨率提升了各模型的运动预测准确性和定位(mIoU)。
  • 更大的 LLM 主干通常在各指标和任务上表现更好。
  • 使用高达 CoPESD 的 100% 能比较小子集在运动类型和方向预测(准确性和 F-score)上具有优越性。
  • CoPESD 使 LVLMs 能够给出精确的下一步运动描述并定位 ESD 场景中的器具。
  • CoPESD 是首个多模态 ESD 动作数据集,支持指令跟随和手术自动化研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。