[논문 리뷰] OnePiece: A Large-Scale Distributed Inference System with RDMA for Complex AI-Generated Content (AIGC) Workflows
OnePiece는 일방 RDMA와 마이크로서비스 분해를 이용하여 다단계 AIGC 워크플로우를 최적화하는 대규모 분산 추론 시스템으로, 새로운 이중 링 버퍼 교착 상태 해결 및 자가 탄력적 리소스 할당을 위한 동적 Node Manager를 제공합니다.
The rapid growth of AI-generated content (AIGC) has enabled high-quality creative production across diverse domains, yet existing systems face critical inefficiencies in throughput, resource utilization, and scalability under concurrent workloads. This paper introduces OnePiece, a large-scale distributed inference system with RDMA optimized for multi-stage AIGC workflows. By decomposing pipelines into fine-grained microservices and leveraging one-sided RDMA communication, OnePiece significantly reduces inter-node latency and CPU overhead while improving GPU utilization. The system incorporates a novel double-ring buffer design to resolve deadlocks in RDMA-aware memory access without CPU involvement. Additionally, a dynamic Node Manager allocates resources elastically across workflow stages in response to real-time load. Experimental results demonstrate that OnePiece reduces GPU resource consumption by 16x in Wan2.1 image-to-video generation compared to monolithic inference pipelines, offering a scalable, fault-tolerant, and efficient solution for production AIGC environments.
연구 동기 및 목표
- 복잡한 AIGC 워크플로우의 처리량, 리소스 활용도 및 확장성 개선 동기 부여.
- 노드 간 대기 시간과 GPU 경쟁 감소를 위한 세분화된 마이크로서비스 파티셔닝 탐구.
- CPU 오버헤드를 우회하고 GPU 활용도를 높이기 위한 RDMA 기반 서비스 간 통신 개발.
- RDMA 메시 전달을 위한 교착 상태 없는 링 버퍼 설계 및 동적 가변 데이터 적용.
- 워크플로우 단계 전반에 걸친 중앙 집중식 Node Manager를 통한 실시간 확장 리소스 관리 제공
제안 방법
- 종단 간 AIGC 파이프라인을 지역적으로 자율적인 워크플로 세트에 분산된 세분화된 마이크로서비스로 분해.
- CPU 개입 최소화를 위해 직접 메모리 간 데이터 전송을 위한 일방 RDMA 채택.
- 메시지의 가변 길이를 지원하고 교착 상태를 회피하는 이중 링 버퍼 구현.
- 고장 허용성과 저지연 결과 검색을 위한 RAM/NVMe 기반 메모리 중심 데이터베이스 및 복제 활용.
- 실시간 부하에 따라 워크플로우 단계 간 GPU 자원을 탄력적으로 재할당하는 Node Manager 도입.
- 개별 모드와 협력 모드의 두 가지 워크플로Scheduling 모드 제공 및 해당 TaskWorker 동작과 ResultDeliver 라우팅 전략
- 파이프라이닝 및 부하 모니터링 이론을 적용하여 다양한 단계 런타임에서도 엔드 투 엔드 처리량을 안정적으로 유지

실험 결과
연구 질문
- RQ1RDMA 기반 통신 및 마이크로서비스 파티셔닝이 다단계 AIGC 워크로드의 처리량과 GPU 활용도에 어떤 영향을 미치는가?
- RQ2CPU 개입 없이 동적 크기의 RDMA 메시지를 지원하는 교착 상태 없는 메시징 메커니즘은 무엇인가?
- RQ3버스트 부하에서 정상 상태의 처리량을 유지하기 위해 파이프라인 단계 간 자원은 어떻게 할당되어야 하는가?
- RQ4다양한 작업 세분성에 대해 AIGC 워크플로우에서 효과적인 스케줄링 전략은 무엇인가?
주요 결과
- OnePiece는 Wan2.1 이미지-에서-비디오 생성에 대해 모놀리식 파이프라인 대비 GPU 자원 사용을 16배 감소시키는 등 상당한 자원 효율성 향상을 달성했다.
- 시스템은 서로 다른 서비스 간 통신에 일방 RDMA를 활용하여 노드 간 대기 시간과 CPU 오버헤드를 감소시킨다.
- CPU 개입 없이 RDMA 관련 교착 상태를 해결하면서도 가변 크기 메시지를 지원하는 이중 링 버퍼가 새로운 해결책을 제시한다.
- Node Manager는 실시간 부하에 따라 워크플로우 단계 간 GPU 자원을 탄력적으로 할당 가능하게 한다.
- 복제와 메모리 중심 데이터베이스 설계는 빠른 결과 저장 및 검색을 제공하며 일시적 데이터 수명 주기를 보장한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.