[논문 리뷰] ESTA: An Esports Trajectory and Action Dataset
이 논문은 오픈소스 awpy 라이브러리를 사용해 1,558판의 프로페셔널 컨트리뷰트 스트라이크: 글로벌 오펜시브 매치에서 추출한 860만 건의 플레이어 행동과 417,000개의 궤적을 포함한 대규모 공개 데이터셋인 ESTA를 소개한다. 이 데이터셋은 승리 확률 예측 모델의 벤치마크를 가능하게 하며, 벡터 기반 접근 방식에 비해 게임 지식(예: '세이브' 전략)과 더 잘 일치하는 세트 기반 모델이 약간 높은 로그 손실을 기록함에도 불구하고 더 우수한 성능을 보인다.
Sports, due to their global reach and impact-rich prediction tasks, are an exciting domain to deploy machine learning models. However, data from conventional sports is often unsuitable for research use due to its size, veracity, and accessibility. To address these issues, we turn to esports, a growing domain that encompasses video games played in a capacity similar to conventional sports. Since esports data is acquired through server logs rather than peripheral sensors, esports provides a unique opportunity to obtain a massive collection of clean and detailed spatiotemporal data, similar to those collected in conventional sports. To parse esports data, we develop awpy, an open-source esports game log parsing library that can extract player trajectories and actions from game logs. Using awpy, we parse 8.6m actions, 7.9m game frames, and 417k trajectories from 1,558 game logs from professional Counter-Strike tournaments to create the Esports Trajectory and Actions (ESTA) dataset. ESTA is one of the largest and most granular publicly available sports data sets to date. We use ESTA to develop benchmarks for win prediction using player-specific information. The ESTA data is available at https://github.com/pnxenopoulos/esta and awpy is made public through PyPI.
연구 동기 및 목표
- 기계 학습 연구를 위한 대규모, 청소년, 접근 가능한 스포츠 데이터의 부족 문제를 해결하기 위해.
- 고비용, 개인정보 우려, 접근 제한 등의 전통적 스포츠 데이터의 한계를 극복하기 위해.
- 공개 가능하고 시공간적 세부 정보가 풍부한 이스포츠 게임 로그를 활용해 확장 가능하고 고정밀도의 대안을 개발하기 위해.
- 스포츠 분석 및 궤적 모델링 연구를 지원하기 위해 공개 가능한 데이터셋과 파싱 도구를 구축하기 위해.
- 플레이어 특화 시공간 데이터를 활용한 승리 확률 예측을 위한 기계 학습 모델의 벤치마크를 제공하기 위해.
제안 방법
- 플레이어 행동, 위치, 게임 상태 메타데이터를 2Hz 해상도로 추출할 수 있도록 설계된 Python 라이브러리인 awpy를 개발하여 컨트리뷰트 스트라이크 게임 리플레이 파일을 파싱하고 분석하며 시각화한다.
- awpy를 사용해 1,558개의 프로페셔널 CSGO 매치 로그를 파싱하여 총 860만 건의 행동, 790만 프레임, 417,000개의 플레이어 궤적을 추출한다.
- 재현 가능성과 확장성을 확보하기 위해 플레이어 행동, 위치, 메타데이터를 포함한 라운드 객체로 데이터를 JSON 형식으로 정렬한다.
- 플레이어 궤적 및 행동 데이터를 활용해 승리 확률을 예측하기 위해 벡터 기반 및 세트 기반 딥러닝 모델(예: 세트 트랜스포머 포함)을 적용한다.
- 라운드 수 확인 및 서버 측 플러그인과 극단적인 케이스에 대한 파서의 강건성을 검증하여 데이터셋의 타당성을 검증한다.
- 로그 손실과 게임 내 전략 지식과의 정성적 일치도를 기준으로 승리 확률 예측 성능을 비교한 벤치마크를 제공한다.
실험 결과
연구 질문
- RQ1이스포츠 게임 로그를 활용해 시공간적 행동 데이터가 결합된 대규모, 고정밀도, 공개 가능한 스포츠 데이터셋을 구축할 수 있는가?
- RQ2플레이어 궤적 및 행동 특징을 활용한 승리 확률 예측에서, 벡터 기반 모델과 세트 기반 모델 간의 성능은 어떻게 다른가?
- RQ3모델 예측은 컨트리뷰트 스트라이크의 전략적 '세이브'와 같은 전통적 게임 지식과 어느 정도 일치하는가?
- RQ4ESTA 데이터셋은 승리 예측 이외의 다양한 기계 학습 작업(예: 궤적 예측 또는 강화 학습 미세조정)을 지원할 수 있는가?
- RQ5게임 상태 샘플링 주기(2Hz)가 1인칭 이스포츠 내 미세한 게임 역학을 모델링하는 데 어떤 영향을 미치는가?
주요 결과
- ESTA 데이터셋은 1,558개의 프로페셔널 CSGO 매치에서 유래한 860만 건의 행동, 790만 프레임, 417,000개의 플레이어 궤적을 포함하며, 시공간 추적 및 이벤트 데이터가 결합된 가장 큰 공개 스포츠 데이터셋 중 하나이다.
- awpy 라이브러리는 대규모로 게임 로그를 성공적으로 파싱하여 플레이어 행동과 위치를 재현 가능한 방식으로 추출할 수 있었으며, PyPI를 통해 공개되어 일반 사용이 가능하다.
- 세트 기반 모델(예: 세트 트랜스포머)은 CT 플레이어가 장비를 보존하기 위해 의도적으로 라운드를 패널 '세이브' 전략과 같은 고수준 게임 현상을 더 잘 포착하지만, 약간 높은 로그 손실을 기록한다.
- 벡터 기반 모델은 폭탄 설치 후 2대 1 상황에서 승리 확률을 과도하게 평가하여 게임 내 전략과 배치되지만, 세트 기반 모델은 더 보수적이며 전문 지식과 더 잘 일치한다.
- 원본 매치 로그와의 라운드 수 일치성 검증을 통해 데이터셋이 일반적인 서버 측 플러그인과 극단적인 케이스에 대해 강건함을 입증하였다.
- rich한 시공간 구조와 공개 가능성 덕분에 ESTA는 승리 예측 이외에도 궤적 예측, 강화 학습 미세조정, 시각적 분석 등 다양한 응용 분야를 지원할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.