[论文解读] Are human interactivity times lognormal?
本文主张,人类在在线社交网络中的互动时间(如发送电子邮件、添加好友、评论等)更应由对数正态分布建模,而非幂律分布,因为对数正态分布能够更好地捕捉从短到长的全部事件间隔时长,而幂律分布常忽略短间隔。作者证明,数据分箱会将对数正态分布扭曲为看似幂律分布的形态,并通过 Digg、Reddit 和 Enron 邮件数据集的实证数据加以支持,表明对数正态分布拟合更准确且理论更合理。
In this paper, we are analyzing the interactivity time, defined as the duration between two consecutive tasks such as sending emails, collecting friends and followers and writing comments in online social networks (OSNs). The distributions of these times are heavy tailed and often described by a power-law distribution. However, power-law distributions usually only fit the heavy tail of empirical data and ignore the information in the smaller value range. Here, we argue that the durations between writing emails or comments, adding friends and receiving followers are likely to follow a lognormal distribution. We discuss the similarities between power-law and lognormal distributions, show that binning of data can deform a lognormal to a power-law distribution and propose an explanation for the appearance of lognormal interactivity times. The historical debate of similarities between lognormal and power-law distributions is reviewed by illustrating the resemblance of measurements in this paper with the historical problem of income and city size distributions.
研究动机与目标
- 挑战人类互动时间服从幂律分布的普遍假设。
- 证明对数正态分布能更好地建模互动时间的完整范围,包括常被幂律拟合排除的短间隔。
- 表明数据分箱可能扭曲对数正态分布,使其呈现看似幂律的行为,从而导致误导性结论。
- 基于 Digg、Reddit 和 Enron 邮件数据提供实证证据,支持对数正态模型。
- 基于对事件间隔时间对数应用中心极限定理,提出对数正态互动时间的理论解释。
提出的方法
- 对 Digg.com、Reddit.com 和 Enron 邮件数据集中的互动时间进行实证分析,比较对数正态分布与幂律分布的拟合效果。
- 使用似然比检验和拟合优度评估来评价分布模型。
- 通过数学推导表明,对数正态分布数据的分箱会改变位置参数 μ,但保持尺度参数 σ 不变,可能造成看似幂律行为的假象。
- 应用中心极限定理,解释为何 log(T)(即互动时间 T 的对数)可能呈正态分布,原因在于多种弱相关行为因素的累积。
- 比较对数正态分布与幂律分布的尾部行为,表明对数正态分布衰减速度更快,从而质疑幂律拟合在极端尾部的有效性。
- 使用变换 X = e^Y(其中 Y 服从指数分布)生成 X 的幂律行为,但表明这暗示 log(T) 具有无记忆性,与人类行为的直觉相悖。
实验结果
研究问题
- RQ1人类互动时间的重尾分布是更应由幂律还是对数正态分布解释?
- RQ2数据分箱在多大程度上扭曲了互动时间的真实分布,特别是将对数正态数据误认为幂律行为?
- RQ3为何对数正态分布的对数形式(而非时间本身)在人类行为过程中更自然?
- RQ4对数正态分布的参数在重标度或分箱后如何变化?这对经验拟合有何影响?
- RQ5幂律分布所隐含的指数分布的无记忆性(即事件间隔时间的幂律模型)能否与人类行为模式相容?还是与直觉相悖?
主要发现
- 在线社交网络中添加好友的互动时间服从幂律分布,指数 γ ≈ 1.8,但获取关注者的事件间隔时间更符合对数正态分布,参数为 μ ≈ 10.5 和 σ ≈ 2.8。
- 对数正态分布覆盖了从短到长的全部事件间隔时间,而幂律拟合常通过设定下限 τ 排除小数值,这一做法缺乏物理解释。
- 对数正态分布数据的分箱会将估计的位置参数 μ 向更小值移动,而保持 σ 不变,从而产生看似幂律行为的假象,且幂律指数 γ 接近 1。
- 存在一个区间,对数正态分布与指数 γ ≈ 1 + ε(ε > 0 且极小)的幂律分布在统计上无法区分,解释了为何幂律拟合在实证数据中常被观察到。
- 幂律模型所隐含的 log(T) 无记忆性与人类行为直觉相悖,因为它暗示过去等待时间不影响未来等待时间,与实际行为模式矛盾。
- 由于多种弱相关行为因素的累积,互动时间的对数更自然地服从正态分布,这通过中心极限定理支持了对数正态模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。