Skip to main content
QUICK REVIEW

[论文解读] Empirical Evaluation of Real World Tournaments

Nicholas Mattei, Toby Walsh|arXiv (Cornell University)|Aug 3, 2016
Mobile Crowdsensing and Crowdsourcing参考文献 43被引用 6
一句话总结

本文通过英格兰超级联赛、德国足球甲级联赛和ATP世界巡回赛的数据,对现实世界中的锦标赛进行了实证评估,表明理论上为NP难的锦标赛操纵问题在实践中可高效求解。研究进一步表明,现实锦标赛结果服从对数正态分布,这与广泛使用的康多塞随机模型相矛盾,后者无法复现现实数据的模式。

ABSTRACT

Computational Social Choice (ComSoc) is a rapidly developing field at the intersection of computer science, economics, social choice, and political science. The study of tournaments is fundamental to ComSoc and many results have been published about tournament solution sets and reasoning in tournaments. Theoretical results in ComSoc tend to be worst case and tell us little about performance in practice. To this end we detail some experiments on tournaments using real wold data from soccer and tennis. We make three main contributions to the understanding of tournaments using real world data from English Premier League, the German Bundesliga, and the ATP World Tour: (1) we find that the NP-hard question of finding a seeding for which a given team can win a tournament is easily solvable in real world instances, (2) using detailed and principled methodology from statistical physics we show that our real world data obeys a log-normal distribution; and (3) leveraging our log-normal distribution result and using robust statistical methods, we show that the popular Condorcet Random (CR) tournament model does not generate realistic tournament data.

研究动机与目标

  • 使用现实世界体育数据评估NP难锦标赛操纵问题(TFP)的实际可解性。
  • 确定现实世界锦标赛结果分布是否与康多塞随机(CR)模型等理论模型一致。
  • 应用稳健的统计方法,识别锦标赛结果真实底层分布。
  • 评估由CR模型生成的合成锦标赛数据与实证数据的现实性对比。
  • 倡导在计算社会选择领域中采用数据驱动的模型验证,超越最坏情况的理论假设。

提出的方法

  • 从英格兰超级联赛、德国足球甲级联赛和ATP世界巡回赛收集现实世界锦标赛数据,用于实证分析。
  • 应用似然比检验和稳健的统计拟合方法,比较结果频率的幂律分布与对数正态分布。
  • 使用对数正态分布模型估计真实数据与合成数据的中位数(μ)和乘法标准差(σ)参数。
  • 使用康多塞随机(CR)模型,通过不同胜率(例如,Pr(b=0.30))生成合成锦标赛。
  • 执行统计假设检验,比较CR模型与真实世界数据的拟合优度。
  • 采用统计物理中的一种系统性方法,验证分布假设并确保模型的合理性。

实验结果

研究问题

  • RQ1NP难的锦标赛操纵问题在现实世界体育锦标赛中是否具有实际可解性?
  • RQ2现实世界锦标赛结果频率是服从幂律分布还是对数正态分布?
  • RQ3广泛使用的康多塞随机(CR)模型是否能准确复现真实锦标赛数据的统计特性?
  • RQ4哪些关键分布参数(例如,μ、σ)最能描述现实世界锦标赛结果?
  • RQ5计算社会选择中的理论模型在多大程度上反映了体育锦标赛中的经验现实?

主要发现

  • 尽管锦标赛操纵问题(TFP)在理论上属于NP难,但在英格兰超级联赛、德国足球甲级联赛和ATP世界巡回赛的真实实例中,该问题在实践中可高效求解。
  • 现实世界锦标赛结果频率服从对数正态分布,似然比检验显示其拟合优度显著优于幂律模型(p = 0.4642,R = 0.7319)。
  • 康多塞随机(CR)模型无法生成现实的锦标赛数据,因其无法匹配现实中观察到的对数正态分布。
  • 2014年德甲联赛数据的对数正态参数为 μ = -4.0717 和 σ = 1.2611,而最佳拟合的CR模型参数为 μ = -3.3823 和 σ = 1.0018,表明两者在分布结构上存在根本性差异。
  • 研究结果表明,以往被认为服从幂律分布的分布(例如体育比赛结果)更可能由独立比赛结果的乘法性质导致,应由对数正态分布更好地解释。
  • 研究结果表明,当前计算社会选择中的生成模型(如CR)若缺乏实证验证,可能具有误导性,因此基于数据的模型选择至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。