Skip to main content
QUICK REVIEW

[논문 리뷰] Academic Torrents: Scalable Data Distribution

Henry Z. Lo, Joseph Cohen|arXiv (Cornell University)|2016. 03. 14.
Data Stream Mining Techniques인용 수 6
한 줄 요약

Academic Torrents는 대규모 기계학습 데이터셋의 분포를 위한 기존 HTTP 서버의 대안으로, 피어 투 피어(P2P) 확장을 제안한다. 이는 사용자 피어를 데이터 소스로 활용함으로써 서버의 병목 현상을 제거하고, 업로드 비용을 최대 98%까지 절감하며, 다운로드 속도를 일주일에서 몇 시간으로 향상시킨다. Reddit 데이터의 경우 42배의 업로드 대 다운로드 비율 절감과 함께, ImageNet에서는 500 KB/s인 HTTP 대비 34 MB/s의 속도를 기록하여 성능 향상을 입증하였다.

ABSTRACT

As competitions get more popular, transferring ever-larger data sets becomes infeasible and costly. For example, downloading the 157.3 GB 2012 ImageNet data set incurs about $4.33 in bandwidth costs per download. Downloading the full ImageNet data set takes 33 days. ImageNet has since become popular beyond the competition, and many papers and models now revolve around this data set. For sharing such an important resource to the machine learning community, the sharers of ImageNet must shoulder a large bandwidth burden. Academic Torrents reduces this burden for disseminating competition data, and also increases download speeds for end users. Academic Torrents is run by a pending nonprofit.. By augmenting an existing HTTP server with a peer-to-peer swarm, requests get re-routed to get data from downloaders. While existing systems slow down with more users, the benefits of Academic Torrents grow, with noticeable effects even when only one other person is downloading.

연구 동기 및 목표

  • 기존 HTTP 서버를 통한 대규모 기계학습 데이터셋 배포 시 발생하는 지속 불가능한 대역폭 비용과 느린 다운로드 속도 문제를 해결하기 위해.
  • ImageNet 및 Reddit 댓글과 같은 대규모 데이터셋을 공유하는 데이터 공급자들의 재정적 및 인프라적 부담을 줄이기 위해.
  • 피어 투 피어 기반 데이터 공유를 통해 다운로드 성능을 향상시켜 최종 사용자에게 더 많은 대역폭 자원을 제공하기 위해.
  • 중앙집중식 HTTP 모델보다 사용자 수 증가에 따라 더 잘 확장되는 커뮤니티 기반의 데이터 배포 모델을 구현하기 위해.
  • 재현 가능한 연구를 지원하기 위해, 대규모 공개 데이터셋을 저비용으로 지속 가능하게 공유할 수 있는 플랫폼을 제공하기 위해.

제안 방법

  • 기존 HTTP 서버에 피어 투 피어(P2P) 스웨어 아키텍처를 추가하여 다수의 다운로더 간 데이터 분산 배포를 구현한다.
  • 토런트 기반 파일 공유 프로토콜을 활용해 사용자가 동시에 여러 피어로부터 데이터를 다운로드할 수 있도록 하여 원본 서버의 부담을 감소시킨다.
  • 각 다운로더가 잠재적인 데이터 소스가 되는 탈중앙화된 스웨어 모델을 적용함으로써, 더 많은 사용자가 참여할수록 전체 대역폭 가용성이 증가한다.
  • 기존 데이터셋(예: Reddit 댓글)에서 관측된 업로드/다운로드 비율을 바탕으로 실제 대역폭 비용 예측을 수행한다.
  • 측정된 다운로드 속도(예: Academic Torrents는 34 MB/s, HTTP는 500 KB/s)를 기반으로 성능 향상 정도를 추정한다.
  • 공개 인덱스를 유지하며, 10.12 TB의 데이터셋을 인덱싱하고 월간 방문자 수 및 일일 데이터 전송량과 같은 사용 지표를 추적한다.

실험 결과

연구 질문

  • RQ1HTTP에 피어 투 피어 확장을 도입함으로써 대규모 데이터셋 배포의 대역폭 비용을 크게 절감할 수 있는가?
  • RQ2기존의 클라이언트-서버 HTTP 기반 배포 방식에 비해 피어 투 피어 공유 방식은 다운로드 속도를 어떻게 향상시키는가?
  • RQ3실제로 구현된 환경에서의 업로드 대 다운로드 비율은 얼마이며, 이를 통해 어떤 비용 절감 효과를 얻을 수 있는가?
  • RQ4커뮤니티 기반의 데이터 공유 방식은 원본 데이터 공급자의 부담을 어느 정도 감소시킬 수 있는가?
  • RQ5사용자 수 증가에 따라 Academic Torrents의 성능은 중앙집중식 HTTP 모델 대비 어떻게 변화하는가?

주요 결과

  • Reddit 공개 댓글 데이터셋은 업로드 대 다운로드 비율이 42.067:1을 기록하여, 매 1바이트의 업로드가 피어로부터 추가 41바이트의 데이터 전송을 유도함을 의미한다.
  • 100회의 다운로드에 대해 Academic Torrents를 사용할 경우, HTTP 기반의 $424.32에서 $10.09로 업로드 대역폭 비용이 97.6% 감소하였다.
  • Academic Torrents에서의 다운로드 속도는 34 MB/s에 도달하여, ImageNet의 1.2 TB 데이터를 HTTP 기반 500 KB/s에서 33일이 걸리던 시간을 9.8시간으로 단축시켰다.
  • 단일 시드어가 366.68 GB만 업로드했음에도 불구하고, 총 15.43 TB의 다운로드가 이루어져 커뮤니티 기여도가 매우 높음을 입증하였다.
  • 현재 Academic Torrents는 월간 30,000명의 고유 방문자를 확보하고 있으며, 10.12 TB의 인덱싱된 데이터셋을 기반으로 하루에 900 GB 이상의 데이터 전송을 처리하고 있다.
  • 시스템은 효과적으로 확장 가능하다: 사용자가 많아질수록 대역폭 가용성이 증가하여, HTTP 모델에서 관찰되는 성능 저하 현상을 뒤집는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.