[论文解读] The Bayesian Echo Chamber: Modeling Social Influence via Linguistic Accommodation
贝叶斯回音室是一种贝叶斯生成模型,通过建模语言适应性——即个体如何调整其语言以匹配他人——来推断群体讨论中的潜在影响关系,采用多变量霍克斯过程的离散类比。该模型在揭示细微影响模式方面优于仅基于发言轮换的模型,其有效性已在美国最高法院听证记录、《12怒汉》和联邦公开市场委员会会议记录中得到验证。
We present the Bayesian Echo Chamber, a new Bayesian generative model for social interaction data. By modeling the evolution of people's language usage over time, this model discovers latent influence relationships between them. Unlike previous work on inferring influence, which has primarily focused on simple temporal dynamics evidenced via turn-taking behavior, our model captures more nuanced influence relationships, evidenced via linguistic accommodation patterns in interaction content. The model, which is based on a discrete analog of the multivariate Hawkes process, permits a fully Bayesian inference algorithm. We validate our model's ability to discover latent influence patterns using transcripts of arguments heard by the US Supreme Court and the movie "12 Angry Men." We showcase our model's capabilities by using it to infer latent influence patterns from Federal Open Market Committee meeting transcripts, demonstrating state-of-the-art performance at uncovering social dynamics in group discussions.
研究动机与目标
- 解决现有影响推断方法仅依赖发言轮换行为的局限性,此类方法可能忽略细微的社会动态。
- 建模个体在群体讨论中如何进行语言适应,以反映潜在的影响关系。
- 开发一个完全基于贝叶斯的生成模型,同时捕捉时间动态和基于内容的影响。
- 验证该模型从真实世界社会互动数据(包括法律和政治话语)中恢复有意义影响网络的能力。
- 展示该模型作为社会科学家分析复杂群体决策过程的探索性工具的实用性。
提出的方法
- 该模型使用离散时间、多变量霍克斯过程来表示对话中个体发言之间相互激发的关系。
- 引入潜在影响参数 ρ^(qp),量化个体 q 的语言使用如何提升个体 p 使用相同词语的可能性。
- 该模型采用贝叶斯分层框架与共轭先验,通过马尔可夫链蒙特卡洛(MCMC)抽样实现完整的后验推断。
- 语言适应被建模为一种动态、时间依赖的激发过程,即某位发言者使用某词语会激发其他人的后续使用。
- 该模型从对话记录中联合推断影响网络、语言使用模式和时间动态,而无需预先指定网络结构。
- 通过共享或非共享参数结构,将该模型与 Blundell 等人的发言轮换模型相结合,以联合建模内容与时间动态。
实验结果
研究问题
- RQ1在口语或书面话语中,语言适应模式是否能揭示比仅依靠发言轮换行为更细微的影响关系?
- RQ2贝叶斯回音室在从合成数据和真实世界互动数据中恢复潜在影响网络方面,准确度如何?
- RQ3与仅基于时间轮换的模型相比,整合语言内容是否能提升影响推断的准确性?
- RQ4该模型能否在高风险群体讨论(如美国最高法院听证会或联邦储备委员会会议)中检测到有意义的影响结构?
- RQ5是否存在一种可跨语言适应与发言轮换动态关联的共享全局影响概念?
主要发现
- 贝叶斯回音室成功从美国最高法院和《12怒汉》的对话记录中推断出影响网络,其结果在实质上比仅基于发言轮换的模型更具可解释性。
- 在《12怒汉》数据集中,陪审员3号和8号被识别为关键影响者,其后验均值影响值分别为134.35和82.09,表明对他人有显著影响。
- 该模型在影响网络推断任务中达到最先进性能,其保留数据的对数似然值低于基线模型(例如,《12怒汉》数据集在非共享参数设置下为-3987.20)。
- 使用后验分位数25%、50%和75%推断的影响网络高度一致,表明即使在不确定性存在的情况下,推断仍具鲁棒性。
- 共享联合模型(在语言内容与发言轮换组件间共享影响参数)的预测似然低于非共享模型,表明对内容与时间动态分别建模可获得更优性能。
- 该模型在合成数据上表现出优异的参数恢复能力,验证了其推断算法和底层生成假设的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。