Skip to main content
QUICK REVIEW

[논문 리뷰] RecD: Deduplication for End-to-End Deep Learning Recommendation Model Training Infrastructure

Mark Zhao, Dhruv Choudhary|arXiv (Cornell University)|2022. 11. 09.
Machine Learning in Healthcare인용 수 4
한 줄 요약

RecD는 세션 중심의 특성 중복을 활용하여 산업용 딥러닝 추천 모델(DLRM) 훈련 파이프라인을 위한 종단 간 최적화 세트를 도입한다. 이는 저장소, 전처리 및 훈련 오버헤드를 줄이는 데 기여한다. 훈련 배치 내에서 중복된 특성을 통합하고, 새로운 텐서 형식인 역키드제이거텐서(IKJTs)를 통해 인코딩함으로써 RecD는 훈련 및 전처리 처리량을 각각 최대 2.48배와 1.79배로 향상시키며, 저장소 효율성은 3.71배 향상시킨다.

ABSTRACT

We present RecD (Recommendation Deduplication), a suite of end-to-end infrastructure optimizations across the Deep Learning Recommendation Model (DLRM) training pipeline. RecD addresses immense storage, preprocessing, and training overheads caused by feature duplication inherent in industry-scale DLRM training datasets. Feature duplication arises because DLRM datasets are generated from interactions. While each user session can generate multiple training samples, many features' values do not change across these samples. We demonstrate how RecD exploits this property, end-to-end, across a deployed training pipeline. RecD optimizes data generation pipelines to decrease dataset storage and preprocessing resource demands and to maximize duplication within a training batch. RecD introduces a new tensor format, InverseKeyedJaggedTensors (IKJTs), to deduplicate feature values in each batch. We show how DLRM model architectures can leverage IKJTs to drastically increase training throughput. RecD improves the training and preprocessing throughput and storage efficiency by up to 2.48x, 1.79x, and 3.71x, respectively, in an industry-scale DLRM training system.

연구 동기 및 목표

  • 세션 중심의 데이터 생성으로 인해 발생하는 산업 규모 DLRM 훈련 데이터셋에서 특성 값 중복의 빈도를 규명하는 것.
  • 종단 간 DLRM 파이프라인 전반에서 중복된 특성 값으로 인한 저장소, 전처리 및 훈련 오버헤드를 줄이는 것.
  • 훈련 배치 내에서 특성을 효율적으로 중복 제거하고 처리할 수 있도록 하는 새로운 텐서 형식인 역키드제이거텐서(IKJTs)를 설계하고 구현하는 것.
  • IKJTs를 활용하여 데이터 인gest, 전처리 및 훈련 워크로드를 최적화하여 불필요한 계산, 메모리 및 네트워크 사용을 제거하는 것.
  • 기존 DLRM 아키텍처에 최소한의 변경으로 IKJTs를 원활하게 통합할 수 있음을 입증하여 광범위한 호환성과 성능 향상을 달성하는 것.

제안 방법

  • 동일한 사용자 세션에서 온 훈련 샘플을 배치 내에서 통합하여 특성 값의 중복을 그룹화함으로써 데이터 국소성과 압축 효율성을 향상시키는 것.
  • 각 배치 내에서 값의 중복을 제거하기 위해 특성 값과 그 역참조를 인코딩하는 새로운 텐서 형식인 역키드제이거텐서(IKJTs)를 도입하는 것.
  • 스라이브(Scribe)에서 원시 추론 로그를 세션 ID 기반으로 샤딩하여 데이터 저장 및 인게스트 시 압축 비율을 향상시키는 것.
  • 읽기 및 훈련 모듈이 IKJTs를 직접 처리할 수 있도록 데이터 처리 파이프라인을 수정하여 읽기 단계에서 데이터를 IKJT 형식으로 소비하고 변환하는 것.
  • 이동 기반 인코딩을 통해 부분 중복 제거를 확장하여 정확한 일치 외에도 추가로 7.8%의 중복 값을 포괄하는 것.
  • 표준화된 제이거 텐서 인터페이스를 활용하여 기존 전처리 함수 및 모델 아키텍처에 대한 수정 최소화로 IKJT 호환성을 확보하는 것.

실험 결과

연구 질문

  • RQ1산업 규모 DLRM 훈련 데이터셋에서 특성 값 중복은 얼마나 흔한가? 이로 인해 저장소, 전처리 및 훈련에 미치는 시스템 수준의 영향은 무엇인가?
  • RQ2동일한 사용자 세션에서 온 샘플을 훈련 배치 내에서 통합하면 데이터 볼륨을 크게 줄이고 압축 효율성을 향상시킬 수 있는가?
  • RQ3훈련 중에 특성을 효율적으로 중복 제거하면서 런타임 오버헤드를 최소화할 수 있는 새로운 텐서 형식은 무엇인가?
  • RQ4기존 DLRM 모델 아키텍처와 훈련 파이프라인은 얼마나 많은 변경 없이 중복 제거된 텐서를 처리할 수 있는가?
  • RQ5실제 산업 환경에서 표준 KJTs와 비교했을 때 IKJTs는 저장소, 전처리 및 훈련 처리량 측면에서 얼마나 높은 성능 향상을 제공하는가?

주요 결과

  • 산업용 DLRM 데이터셋에서 동일한 사용자 세션의 샘플들 간 특성 값 중복 비율은 81.6~89.4%를 차지하여 중복의 주요 원인이 됨을 확인함.
  • RecD는 산업 규모 DLRM 훈련 시스템에서 훈련 처리량을 최대 2.48배, 전처리 처리량을 최대 1.79배 향상시킴.
  • 세션 기반 데이터 통합으로 인해 효과적인 중복 제거 및 압축 향상으로 인해 저장소 효율성이 최대 3.71배 향상됨.
  • 역키드제이거텐서(IKJT) 형식은 최소한의 런타임 오버헤드로 효율적인 중복 제거를 가능하게 하여 전처리 및 훈련 파이프라인에서 직접 사용 가능.
  • 부분 IKJTs는 정확한 일치 외에도 추가로 7.8%의 중복 값을 포괄함으로써 총 중복 제거 커버리지가 91.7%(81.6% 정확 일치 + 7.8% 부분 일치)로 증가.
  • RecD의 최적화는 다양한 테이블 스키마와 모델 아키텍처에 일반화 가능하며, 호환성을 확보하기 위해 특성 컨버터와 index_select만 추가로 필요함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.