[论文解读] OnePiece: A Large-Scale Distributed Inference System with RDMA for Complex AI-Generated Content (AIGC) Workflows
OnePiece 是一个大规模分布式推理系统,利用单边 RDMA 和微服务解耦来优化多阶段 AIGC 工作流,并提出新的双环缓冲区死锁消解方案以及用于弹性资源分配的动态节点管理器。
The rapid growth of AI-generated content (AIGC) has enabled high-quality creative production across diverse domains, yet existing systems face critical inefficiencies in throughput, resource utilization, and scalability under concurrent workloads. This paper introduces OnePiece, a large-scale distributed inference system with RDMA optimized for multi-stage AIGC workflows. By decomposing pipelines into fine-grained microservices and leveraging one-sided RDMA communication, OnePiece significantly reduces inter-node latency and CPU overhead while improving GPU utilization. The system incorporates a novel double-ring buffer design to resolve deadlocks in RDMA-aware memory access without CPU involvement. Additionally, a dynamic Node Manager allocates resources elastically across workflow stages in response to real-time load. Experimental results demonstrate that OnePiece reduces GPU resource consumption by 16x in Wan2.1 image-to-video generation compared to monolithic inference pipelines, offering a scalable, fault-tolerant, and efficient solution for production AIGC environments.
研究动机与目标
- 提高复杂 AIGC 工作流的吞吐量、资源利用率和可扩展性
- 探索细粒度微服务划分以降低跨节点延迟和 GPU 争用
- 开发基于 RDMA 的服务间通信以规避 CPU 开销并提升 GPU 利用率
- 引入无死锁的 RDMA 消息传递环形缓冲设计,支持动态大小数据
- 通过集中式节点管理实现跨工作流阶段的弹性、实时资源管理
提出的方法
- 将端到端 AIGC 流水线解耦为分布在区域自治工作流集上的细粒度微服务
- 采用单边 RDMA 进行直接内存到内存的数据传输以最小化 CPU 参与
- 实现一个双环缓冲区,实现基于 RDMA 的无死锁消息传递并支持动态大小的消息
- 使用以 RAM/NVMe 为基础、具备复制的以内存为中心的数据库,提供容错和低延迟结果检索
- 引入节点管理器,根据实时负载在工作流阶段间弹性重新分配 GPU 资源
- 提供两种工作流调度模式(独立模式和协同模式),并实现相应的 TaskWorker 行为与 ResultDeliver 路由策略
- 应用流水线与负载监控理论,在不同阶段运行时保持端到端吞吐量的稳定性

实验结果
研究问题
- RQ1 RDMA 基于通信和微服务划分如何提升多阶段 AIGC 工作负载的吞吐量与 GPU 利用率?
- RQ2哪些无死锁的消息传递机制可以在不需要 CPU 参与的情况下支持动态大小的 RDMA 消息?
- RQ3在突发负载下,如何在流水线阶段之间分配资源以维持稳定状态吞吐量?
- RQ4在 AIGC 工作流中对于不同任务粒度,哪些调度策略最为有效?
主要发现
- OnePiece 实现了显著的资源效率提升,相较于单体流水线,在 Wan2.1 图像到视频生成任务上 GPU 资源使用量降低了 16 倍
- 系统通过利用单边 RDMA 进行服务间通信,降低了跨节点延迟和 CPU 开销
- 新颖的双环缓冲区在不需要 CPU 参与的情况下解决了与 RDMA 相关的死锁问题,并支持动态消息大小
- 节点管理器实现了跨工作流阶段对 GPU 资源的弹性分配以响应实时负载
- 以内存为中心的数据库设计,具备复制能力,提供快速结果存储与检索,且支持短暂数据生命周期

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。