Skip to main content
QUICK REVIEW

[논문 리뷰] RedDwarfData: a simplified dataset of StarCraft matches

J. J. Merelo, Antonio Fernández-Ares|arXiv (Cornell University)|2017. 12. 29.
Artificial Intelligence in Games참고 문헌 2인용 수 3
한 줄 요약

RedDwarfData는 Robertson와 Watson의 데이터베이스에서 유도된 4,655판의 StarCraft 대전에 대한 경량이며 사전 처리된 CSV 데이터셋을 제공한다. 이 데이터셋은 고정 프레임이 아닌 자원 변화를 기반으로 샘플링하여 단순화된 것으로, 균형 잡힌 종족 분포와 바로 사용할 수 있는 시간적 특징을 갖추고 있어 강화학습 및 예측 모델의 효율적 훈련과 분석을 가능하게 하며, 연구 및 봇 개발을 위해 오픈소스 GitHub 라이선스로 배포된다.

ABSTRACT

The game Starcraft is one of the most interesting arenas to test new machine learning and computational intelligence techniques; however, StarCraft matches take a long time and creating a good dataset for training can be hard. Besides, analyzing match logs to extract the main characteristics can also be done in many different ways to the point that extracting and processing data itself can take an inordinate amount of time and of course, depending on what you choose, can bias learning algorithms. In this paper we present a simplified dataset extracted from the set of matches published by Robinson and Watson, which we have called RedDwarfData, containing several thousand matches processed to frames, so that temporal studies can also be undertaken. This dataset is available from GitHub under a free license. An initial analysis and appraisal of these matches is also made.

연구 동기 및 목표

  • 기계학습 연구에서 전체 StarCraft 재생 데이터셋을 사용할 경우 발생하는 높은 계산 및 데이터 처리 부담 문제를 해결하기 위해.
  • 시간적 역동성을 유지하면서도 자원 소비를 줄여 훈련 및 분석에 적합한 단순화된 접근 가능한 데이터셋을 만들기 위해.
  • 감독학습 및 봇 평가에 사용할 수 있도록 모든 종족 조합과 경기 지속 시간에 걸쳐 균형 잡힌 사전 처리된 데이터셋을 제공하기 위해.
  • 대규모 원시 재생 데이터셋 대비 경량 대체 자료를 제공함으로써 강화학습 및 진화 알고리즘 기반 봇 개발의 실험 속도를 향상시키기 위해.
  • 게임 로그에서 구조화되고 시간에 맞춰 정렬된 특징 추출을 통해 경기 결과의 조기 예측 및 전략 분석을 지원하기 위해.

제안 방법

  • TeamLiquid 및 BWReplays의 재생 로그에 초점을 맞춘 Robertson와 Watson의 원본 관계형 데이터베이스에서 데이터를 추출하였다.
  • 고정 프레임 샘플링 대신 자원 변화(광물, 베스펜 가스, 공급) 기반으로 시간 기준 이벤트를 선택하여 시간적 관련성을 유지하였다.
  • 지역 별 값의 합산을 통해 단위 수와 자원 값을 지도 영역별로 집계하고, 누락된 데이터를 최소화하기 위해 마지막으로 알려진 값을 앞으로 전파하였다.
  • 가시성에 기반한 추정치를 활용해 적대군 단위 수를 매핑하였으며, 가시성 부족으로 인한 본질적 불확실성을 고려하였다.
  • 모든 처리된 데이터를 표준 CSV 형식으로 내보내어 추가 파싱이나 실행 없이 머신러닝 파이프라인에서 바로 사용할 수 있도록 하였다.
  • 모든 종족 조합(Zerg, Protoss, Terran)과 지속 시간에 걸쳐 경기 수를 균형 잡힌 분포로 포함시켜 데이터 균형을 확보하였다.

실험 결과

연구 질문

  • RQ1완전한 StarCraft 재생 로그에서 유도된 단순화된 경량 데이터셋이 시간적 및 전략적 정밀도를 손상시키지 않고 효과적인 머신러닝 훈련을 지원할 수 있는가?
  • RQ2대규모 실세계 재생 데이터셋에서 다양한 종족 조합 간의 경기 지속 시간과 결과의 분포는 어떻게 달라지는가?
  • RQ3자원 변화 이벤트가 실시간 전략 게임의 게임 진행 모델링에 효과적인 시간 기준으로 작용할 수 있는가?
  • RQ4이 데이터셋에서 Zerg 종족이 승률 면에서 본질적으로 우세한 편인가, 그리고 이는 특정 게임 내 역동성과 관련이 있는가?
  • RQ5사전 처리된 CSV 형식의 데이터셋이 강화학습 및 봇 평가를 위한 데이터 준비 시간과 복잡성을 줄일 수 있는가?

주요 결과

  • RedDwarfData 데이터셋은 모든 종족 조합에 대해 균형 잡힌 표현을 갖춘 4,655판의 StarCraft 대전을 포함하며, Terran vs. Protoss 대전가 1,900건 이상, Zerg 참가 비중도 높다.
  • 평균 경기 지속 시간은 25.26분이며, 모드는 20–25분 사이로, 상대적으로 대칭적이고 편향되지 않은 분포를 나타낸다.
  • Zerg 플레이어는 참여한 경기 중 가장 높은 승률를 기록하여 데이터셋 내에서 전략적 우위가 있을 가능성이 있다.
  • 경기 지속 시간은 종족 정체성보다 게임 내 역동성에 의해 더 크게 영향을 받으며, Zerg vs. Zerg 및 Protoss vs. Protoss 대전에서는 길이에 상당한 이질성이 나타난다.
  • 자원 변화 이벤트를 시간 기준으로 사용함으로써 데이터의 과다 증식과 누락된 값 문제를 줄이고 마지막 알려진 값 보간 기법을 통해 정확한 시간 추적을 가능하게 하였다.
  • 이 데이터셋은 GitHub에 오픈소스로 공개되어 있으며 Apache 라이선스 하에 표준 CSV 형식으로 제공되어 머신러닝 및 봇 개발 워크플로우에서 즉시 활용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.