[论文解读] Patterns of Individual Shopping Behavior
本研究利用10,000个银行账户在三个月内的匿名交易数据,分析个人购物行为,发现尽管由于事件交错导致每日购物序列难以预测,但在更长的时间尺度上整体行为具有高度可预测性。主要发现表明,富裕人群因访问的商店种类更多,表现出更高的熵值,且更倾向于将购物行程打包;而低收入人群则表现出更强的日常例行可预测性,其行为集中于核心商店。
Much of economic theory is built on observations of aggregate, rather than individual, behavior. Here, we present novel findings on human shopping patterns at the resolution of a single purchase. Our results suggest that much of our seemingly elective activity is actually driven by simple routines. While the interleaving of shopping events creates randomness at the small scale, on the whole consumer behavior is largely predictable. We also examine income-dependent differences in how people shop, and find that wealthy individuals are more likely to bundle shopping trips. These results validate previous work on mobility from cell phone data, while describing the unpredictability of behavior at higher resolution.
研究动机与目标
- 利用真实交易数据,在高时间分辨率下研究个人购物行为的可预测性。
- 考察收入等人口统计因素如何影响购物模式,包括行程打包和商店多样性。
- 比较信息论中的熵度量(随机、无时间相关性、真实)在购物行为中的应用,以评估序列与频率在可预测性中的作用。
- 验证并拓展基于手机数据的先前移动性研究,推广至金融交易模式。
- 探讨在短期与长期时间尺度下,行为惯例与个体选择何者占主导地位。
提出的方法
- 本研究使用美国一家主要银行的10,000个匿名金融账户的随机样本,涵盖2010年第一季度的所有卡片交易、现金提款和电汇交易。
- 通过商户类别代码(MCC)对商户进行分类,个人收入通过账户流入金额估算。
- 购物序列被建模为网络结构,其中节点代表商户,边权重表示商户之间的转移概率。
- 计算三种形式的信息论熵:随机熵(log₂Nᵢ)、时间无相关熵(∑pᵢ(j)log₂pᵢ(j)),以及真实熵(基于科莫戈罗夫复杂度近似法计算的序列复杂度)。
- 通过蒙特卡洛模拟对购物序列进行随机化和排序,以分离时间顺序对熵的影响。
- 根据年收入流入将富裕与低收入个体分组:年收入低于16,000美元(低收入)和高于80,000美元(高收入),并比较其商店多样性、访问频率方差及行程打包行为。
实验结果
研究问题
- RQ1尽管每日购物行为看似随机,但个人购物行为在更长时间尺度上在多大程度上是可预测的?
- RQ2收入水平与购物行为(特别是商店多样性、访问频率和行程打包)之间存在何种关联?
- RQ3购物顺序是否显著影响购物行为的真实熵?还是主要由访问次数和频率决定?
- RQ4信息论熵度量在金融交易数据与先前基于手机移动性研究中的表现有何异同?
- RQ5哪些行为机制(如行程打包或对多样性的偏好)解释了富裕与低收入个体之间可预测性的差异?
主要发现
- 富裕人群访问的商店种类显著多于低收入人群,导致随机熵更高(p < 0.01),两位高度可预测个体之间商户类别的重叠概率为31.4%,而一位可预测个体与一位不可预测个体之间的重叠概率仅为11.2%。
- 尽管整体熵值更高,富裕人群在随机熵与无时间相关熵之间的差异更大,表明其行为更受访问时间分布的影响,而不仅仅是商店种类的多样性。
- 富裕人群在各商店的访问次数方差更高,支持其更高熵值源于对多样性的偏好,而非时间分布。
- 富裕消费者打包购物行程的可能性超过两倍,其每日活动区间方差更高,表明其倾向于在单次出行中协调多个商店的购买行为。
- 当购物序列被随机化后,真实熵基本保持不变,表明序列顺序对可预测性的贡献较小;然而,将序列按周区间排序后,熵值显著降低,接近手机数据中观察到的水平。
- 商店访问频率符合齐普夫定律(s = 4 ± 0.031),即排名为N的商店被访问的概率遵循幂律分布,且与所访问的总商店数量无关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。