[논문 리뷰] Check-N-Run: A Checkpointing System for Training Recommendation Models.
Check-N-Run은 대규모 추천 모델 훈련을 위한 확장 가능한 체크포인팅 시스템으로, 적층적 체크포인팅과 모델 양자화를 조합하여 쓰기 대역폭을 6–17배 감소시키고 스토리지 용량을 2.5–8배 감소시켜 체크포인팅 효율을 크게 향상시키며 총 소유비용을 낮추지만 훈련 정확도를 희생시키지 않는다.
Checkpoints play an important role in training recommendation systems at scale. They are important for many use cases, including failure recovery to ensure rapid training progress, and online training to improve inference prediction accuracy. Checkpoints are typically written to remote, persistent storage. Given the typically large and ever-increasing recommendation model sizes, the checkpoint frequency and effectiveness is often bottlenecked by the storage write bandwidth and capacity, as well as the network bandwidth. We present Check-N-Run, a scalable checkpointing system for training large recommendation models. Check-N-Run uses two primary approaches to address these challenges. First, it applies incremental checkpointing, which tracks and checkpoints the modified part of the model. On top of that, it leverages quantization techniques to significantly reduce the checkpoint size, without degrading training accuracy. These techniques allow Check-N-Run to reduce the required write bandwidth by 6-17x and the required capacity by 2.5-8x on real-world models at Facebook, and thereby significantly improve checkpoint capabilities while reducing the total cost of ownership.
연구 동기 및 목표
- 대규모 추천 모델 훈련에서 체크포인팅의 확장성 문제를 해결하기 위해.
- 빈번하고 큰 체크포인트 기록으로 인한 높은 스토리지 및 네트워크 대역폭 오버헤드를 줄이기 위해.
- 체크포인트 크기와 기록 빈도를 최소화하면서도 훈련 정확도를 유지하기 위해.
- 체크포인팅 I/O 최적화를 통해 훈련 시스템의 총 소유비용을 낮추기 위해.
- 효율적인 체크포인팅을 통해 더 빠른 장애 복구와 더 효과적인 온라인 훈련을 가능하게 하기 위해.
제안 방법
- 적층적 체크포인팅을 사용하여 모델의 수정된 부분만 추적하고 영속적으로 저장함으로써 중복 쓰기 작업을 줄임.
- 양자화 기법을 적용하여 모델 가중치를 압축함으로써 체크포인트 크기를 크게 감소시킴.
- 체크포인팅 정확도를 유지하기 위해 적층적 체크포인팅과 훈련 후 양자화를 통합함.
- 변경된 파라미터를 우선순위로 지정하고 저정밀도 표현을 활용하여 체크포인트 기록을 최적화함.
- 기존 훈련 프레임워크와의 호환성을 고려해 최소한의 수정으로도 작동하도록 아키텍처 설계함.
- 모델 업데이트 패턴에 따라 체크포인트 빈도와 크기를 동적으로 균형 잡음.
실험 결과
연구 질문
- RQ1대규모 추천 모델 훈련에서 체크포인팅 오버헤드는 어떻게 줄일 수 있는가?
- RQ2적층적 체크포인팅은 얼마나 많은 쓰기 대역폭과 스토리지 용량 감소를 이룰 수 있는가?
- RQ3양자화 기법은 체크포인트 크기를 줄이면서도 훈련 정확도를 유지할 수 있는가?
- RQ4적층적 체크포인팅과 양자화를 결합했을 때 시스템 효율성과 비용에 어떤 영향을 미치는가?
- RQ5실제 워크로드 환경에서 대규모로 운영될 경우 시스템 성능은 어떠한가?
주요 결과
- Check-N-Run은 페이스북의 실제 추천 모델에서 쓰기 대역폭을 6–17배 감소시킴.
- 시스템은 스토리지 용량을 2.5–8배 감소시켜 인프라 비용을 크게 낮춤.
- 강력한 양자화와 적층적 체크포인팅에도 불구하고 모델 정확도가 유지됨.
- 적층적 체크포인팅과 양자화의 조합은 더 자주이고 효율적으로 체크포인트를 생성할 수 있도록 가능하게 함.
- 시스템은 장애 복구 속도를 향상시키고 더 효과적인 온라인 훈련을 지원함.
- 훈련 안정성과 성능을 유지하면서도 상당한 비용 절감 효과를 달성함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.