Skip to main content
QUICK REVIEW

[논문 리뷰] Startup success prediction and VC portfolio simulation using CrunchBase data

Mark Potanin, Andrey Chertok|arXiv (Cornell University)|2023. 09. 27.
Private Equity and Venture CapitalBusiness, Management and Accounting인용 수 3
한 줄 요약

이 논문은 크런치베이스 데이터를 사용하여 시리즈 B/C 단계에서 스타트업 성공 여부를 예측하는 딥러닝 모델을 제안한다. 투자 유치 지표, 공동창업자 특성, 산업 분야 데이터를 통합하여, 벤처 캐피탈 펀드의 철저한 백테스팅 시뮬레이션을 수행하여 리볼루트와 까지브 등 고성장 스타트업을 정확히 식별한 결과, 자본 성장률 14배, AUC 86%를 달성하였다.

ABSTRACT

Predicting startup success presents a formidable challenge due to the inherently volatile landscape of the entrepreneurial ecosystem. The advent of extensive databases like Crunchbase jointly with available open data enables the application of machine learning and artificial intelligence for more accurate predictive analytics. This paper focuses on startups at their Series B and Series C investment stages, aiming to predict key success milestones such as achieving an Initial Public Offering (IPO), attaining unicorn status, or executing a successful Merger and Acquisition (M\&A). We introduce novel deep learning model for predicting startup success, integrating a variety of factors such as funding metrics, founder features, industry category. A distinctive feature of our research is the use of a comprehensive backtesting algorithm designed to simulate the venture capital investment process. This simulation allows for a robust evaluation of our model's performance against historical data, providing actionable insights into its practical utility in real-world investment contexts. Evaluating our model on Crunchbase's, we achieved a 14 times capital growth and successfully identified on B round high-potential startups including Revolut, DigitalOcean, Klarna, Github and others. Our empirical findings illuminate the importance of incorporating diverse feature sets in enhancing the model's predictive accuracy. In summary, our work demonstrates the considerable promise of deep learning models and alternative unstructured data in predicting startup success and sets the stage for future advancements in this research area.

연구 동기 및 목표

  • 머신러닝을 활용해 IPO, M&A, 유니콘 등 스타트업 성공 이정표의 정확도를 향상시키는 것.
  • 과거 데이터 기반의 백테스팅을 통해 실제 벤처 캐피탈 펀드 운영 방식을 시뮬레이션하여 모델 성능을 실질적 투자 환경에서 평가하는 것.
  • 투자 유치 이력, 공동창업자 특성, 산업 분류 등 이질적인 데이터 소스를 통합하여 예측 성능을 향상시키는 것.
  • 훈련 데이터에 투자 결정 시점 이전에 확보 가능한 정보만 포함되도록 하여 데이터 泄露를 최소화하는 것.
  • 공개 이벤트 이전에 고성장 잠재력을 지닌 스타트업을 식별하고 포트폴리오 성과를 시뮬레이션함으로써 벤처 캐피탈에 실질적인 통찰을 제공하는 것.

제안 방법

  • 34,470개의 스타트업으로 구성된 데이터셋을 기반으로, 투자 라운드, 공동창업자 배경, 산업 분류 등의 특징을 사용해 딥러닝 모델을 훈련시켰다.
  • 과거 데이터 가용성과 정해진 기준에 따라 스타트업을 선별함으로써 펀드 운영 방식을 시뮬레이션하는 백테스팅 알고리즘을 구현했다.
  • 데이터 泄露를 방지하기 위해 엄격한 시간 순서 제약 조건을 적용하여, 각 투자 라운드 이전에 확보된 정보만 훈련에 사용하도록 했다.
  • 투자 규칙 정의: 자산 가치가 10억 달러 이하이고 매우 큰 라운드 투자에 해당하지 않는 기업은 펀드에 포함; 자산 가치가 25억 달러 이상이거나 3년 이상 투자 라운드가 없는 경우 제거.
  • IPO, 인수, 유니콘 등 성공 기준을 설정하고, 자본 성장률과 ROC AUC 지표를 사용해 포트폴리오 성과를 측정했다.
  • 미래의 모델 향상에 대비해 소셜 미디어, 기업 웹사이트, 투자자 프로필 등의 보완 데이터 소스를 탐색하였다.

실험 결과

연구 질문

  • RQ1크런치베이스 데이터를 기반으로 훈련된 딥러닝 모델이 시리즈 B/C 단계에서 IPO, M&A, 유니콘 등 성공 이정표를 정확히 예측할 수 있는가?
  • RQ2벤처 캐피탈 펀드 운영을 시뮬레이션하는 백테스팅이 실제 투자 환경에서의 스타트업 예측 모델 성능 평가에 얼마나 효과적인가?
  • RQ3특히 공동창업자 수준의 특성과 투자 유치 지표를 포함한 다양한 입력 특성은 수치적 특성만을 사용할 경우에 비해 예측 정확도를 얼마나 향상시키는가?
  • RQ4이 모델을 기반으로 한 시뮬레이션된 VC 펀드의 경제적 영향은 전통적인 직관 기반 투자 방식과 비교해 어떻게 나타나는가?
  • RQ5소셜 미디어, 기업 웹사이트 등 추가적인 비정형 데이터는 모델의 예측 능력과 포트폴리오 시뮬레이션 정확도를 어떻게 향상시킬 수 있는가?

주요 결과

  • 모델은 ROC_AUC 점수 86%를 기록하여 실패한 스타트업과 성공한 스타트업을 강력하게 구분하는 능력을 보였다.
  • 2016~2021년 백테스트 기간 동안 시뮬레이션된 VC 펀드가 자본 성장률 14배를 달성하여 뚜렷한 경제적 잠재력을 입증했다.
  • 리볼루트, 디지털오션, 클라르나, 까지브 등 고성장 잠재력을 지닌 스타트업을 주요 성공 이벤트 이전에 정확히 식별했다.
  • 공동창업자 배경, 투자자 네트워크, 투자 유치 이력 등 이질적 특성의 통합이 예측 정확도를 크게 향상시켰다.
  • 백테스팅 프레임워크는 데이터 泄露 없이 실제 펀드 운영 방식을 효과적으로 시뮬레이션하여 공정하고 현실적인 모델 성능 평가를 가능하게 했다.
  • 향후 개선 방안으로 LinkedIn, 트위터, 기업 웹사이트의 텍스트 데이터 통합과 더불어 초기 창립 스타트업을 포함하도록 필터 조정이 가능할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.