Skip to main content
QUICK REVIEW

[论文解读] ESTA: An Esports Trajectory and Action Dataset

Peter Xenopoulos, Claudio Silva|arXiv (Cornell University)|Sep 20, 2022
Gambling Behavior and Treatments被引用 8
一句话总结

本论文介绍了ESTA,一个大规模、公开可用的数据集,包含从1,558场职业《反恐精英:全球攻势》(Counter-Strike: Global Offensive)比赛中提取的860万条玩家动作和41.7万条轨迹数据,数据通过开源awpy库提取。该数据集支持胜率预测模型的基准测试,结果显示,尽管对数损失略高,基于集合的模型在与游戏知识(如“保存”策略)的对齐方面优于基于向量的方法。

ABSTRACT

Sports, due to their global reach and impact-rich prediction tasks, are an exciting domain to deploy machine learning models. However, data from conventional sports is often unsuitable for research use due to its size, veracity, and accessibility. To address these issues, we turn to esports, a growing domain that encompasses video games played in a capacity similar to conventional sports. Since esports data is acquired through server logs rather than peripheral sensors, esports provides a unique opportunity to obtain a massive collection of clean and detailed spatiotemporal data, similar to those collected in conventional sports. To parse esports data, we develop awpy, an open-source esports game log parsing library that can extract player trajectories and actions from game logs. Using awpy, we parse 8.6m actions, 7.9m game frames, and 417k trajectories from 1,558 game logs from professional Counter-Strike tournaments to create the Esports Trajectory and Actions (ESTA) dataset. ESTA is one of the largest and most granular publicly available sports data sets to date. We use ESTA to develop benchmarks for win prediction using player-specific information. The ESTA data is available at https://github.com/pnxenopoulos/esta and awpy is made public through PyPI.

研究动机与目标

  • 为机器学习研究解决大规模、清洁且可访问的体育数据稀缺问题。
  • 克服传统体育数据的局限性,如高昂成本、隐私担忧和访问受限。
  • 利用公开获取且富含时空细节的电子竞技游戏日志,开发可扩展、高保真的替代方案。
  • 创建公开可访问的数据集和解析工具,以支持体育分析与轨迹建模研究。
  • 利用玩家特定的时空数据,对胜率预测的机器学习模型进行基准测试。

提出的方法

  • 开发awpy,一个Python库,用于解析、分析和可视化《反恐精英》游戏回放文件,以2Hz的分辨率提取玩家动作、位置和游戏状态元数据。
  • 使用awpy解析1,558场职业CSGO比赛日志,提取860万条动作、790万帧和41.7万条玩家轨迹。
  • 将数据结构化为JSON格式,包含包含玩家动作、位置和元数据的游戏回合对象,以确保可复现性和可扩展性。
  • 应用基于向量和基于集合的深度学习模型(包括Set Transformers),利用玩家轨迹和动作数据预测胜率。
  • 通过交叉核对回合数量,并验证解析器对服务器端插件和边缘情况的鲁棒性,对数据集进行验证。
  • 提供胜率预测的基准测试,通过对数损失和与游戏中实际游戏知识的定性一致性比较模型性能。

实验结果

研究问题

  • RQ1能否利用电子竞技游戏日志创建大规模、高保真且公开可访问的体育数据集,实现轨迹与动作数据的耦合?
  • RQ2基于向量与基于集合的深度学习模型在利用玩家轨迹和动作特征预测胜率时表现如何?
  • RQ3模型预测在多大程度上与常规游戏知识(如《反恐精英》中的战略性‘保存’)保持一致?
  • RQ4ESTA数据集能否支持胜率预测以外的多样化机器学习任务,如轨迹预测或强化学习预训练?
  • RQ5以2Hz的频率采样游戏状态,对第一人称电子竞技中细微游戏动态的建模有何影响?

主要发现

  • ESTA数据集包含来自1,558场职业CSGO比赛的860万条动作、790万帧和41.7万条玩家轨迹,是目前公开可用的、兼具追踪与事件数据的最大的体育数据集之一。
  • awpy库成功实现了大规模游戏日志的解析,可复现地提取玩家动作与位置信息,且可通过PyPI公开获取。
  • 基于集合的模型(如Set Transformers)能更好地捕捉高层级游戏现象,如‘保存’策略(CT方玩家故意输掉一回合以保留装备),尽管对数损失略高。
  • 基于向量的模型在炸弹投掷后的2v1局面中高估胜率,与实际游戏策略相悖;而基于集合的模型则更保守,与专家知识更一致。
  • 数据集对常见服务器端插件和边缘情况具有鲁棒性,经验证与原始比赛日志的回合数量一致。
  • 由于其丰富的时空结构和公开可及性,ESTA支持多样化的应用,包括轨迹预测、强化学习预训练和可视化分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。