[论文解读] Socio-spatial Self-organizing Maps: Using Social Media to Assess Relevant Geographies for Exposure to Social Processes
本文提出社会空间自组织映射(SS-SOMs),一种新颖的方法,通过神经嵌入与拓扑约束聚类,利用地理位置标注的Twitter数据中的潜在社会态度,识别地理上连贯的区域。该方法在识别纽约市男男性行为者(MSM)对种族主义和恐同主义的暴露程度方面,优于基于邮编的聚合方法,揭示了高达42%更高的变异度,展示了其在更高空间粒度和准确度下捕捉细微、动态社会环境暴露的能力。
Social media offers a unique window into attitudes like racism and homophobia, exposure to which are important, hard to measure and understudied social determinants of health. However, individual geo-located observations from social media are noisy and geographically inconsistent. Existing areas by which exposures are measured, like Zip codes, average over irrelevant administratively-defined boundaries. Hence, in order to enable studies of online social environmental measures like attitudes on social media and their possible relationship to health outcomes, first there is a need for a method to define the collective, underlying degree of social media attitudes by region. To address this, we create the Socio-spatial-Self organizing map, "SS-SOM" pipeline to best identify regions by their latent social attitude from Twitter posts. SS-SOMs use neural embedding for text-classification, and augment traditional SOMs to generate a controlled number of nonoverlapping, topologically-constrained and topically-similar clusters. We find that not only are SS-SOMs robust to missing data, the exposure of a cohort of men who are susceptible to multiple racism and homophobia-linked health outcomes, changes by up to 42% using SS-SOM measures as compared to using Zip code-based measures.
研究动机与目标
- 为解决在高空间分辨率下测量种族主义和恐同主义等社会敏感、难以调查的态度的挑战。
- 克服邮编等行政边界的局限性,这些边界会平均化异质的社会环境。
- 开发一种基于嘈杂、稀疏社交媒体数据中集体情绪的、识别地理上连贯、拓扑约束区域的方法。
- 为公共卫生和社会科学研究中更准确地评估社会环境暴露提供支持。
- 通过使用纽约市年轻男男性行为者(MSM)关于种族主义和恐同主义的真实世界数据,展示该方法的实用性。
提出的方法
- SS-SOM流程结合了用于文本分类的神经嵌入技术,以从关于种族主义和恐同主义的Twitter帖子中提取情感。
- 应用改进的自组织映射(SOM)算法,根据潜在社会情感将地理位置标注的推文聚类为非重叠、拓扑约束的区域。
- 通过根据数据密度对区域进行加权,考虑推文数量的空间变化,从而提高对稀疏或嘈杂观测结果的鲁棒性。
- 采用两阶段流程:首先,使用精心筛选的关键词列表和人工标注指南,将推文标记为种族主义或恐同主义;其次,基于嵌入的情感向量进行聚类。
- 生成的聚类代表特定地理子区域的集体社会态度,以经验推导的社会地理替代任意的行政边界。
- 通过将基于SS-SOM的暴露度量与传统邮编聚合方法在纽约市MSM队列中的结果进行比较,验证了该方法。
实验结果
研究问题
- RQ1如何利用社交媒体数据基于潜在社会态度(如种族主义和恐同主义)识别地理上有意义的区域?
- RQ2SS-SOM推导出的暴露度量在捕捉社会环境暴露变异方面,与基于邮编边界的度量相比,差异程度如何?
- RQ3SS-SOMs在地理社交媒体流中存在缺失或稀疏数据时的鲁棒性如何?
- RQ4在线表达的种族主义与恐同主义之间的空间关系是什么?它们在不同社区中如何共现?
- RQ5SS-SOMs能否检测到反映现实社会过程、且比行政单位分辨率更高的有意义、拓扑连贯的社会聚类?
主要发现
- SS-SOMs能够成功识别基于Twitter数据中潜在社会情感的非重叠、拓扑约束且主题相似的地理聚类。
- 由于采用了数据密度加权机制,该方法对缺失数据具有鲁棒性,即使在推文数量较少的区域也能表现良好。
- 在纽约市MSM队列中的应用表明,基于SS-SOM的暴露度量揭示了种族主义和恐同主义暴露程度比邮编度量高出高达42%的变异度。
- 在线种族主义和恐同主义的普遍性通常呈正相关,但反之不成立:在许多地区,恐同主义比种族主义更普遍,表明存在不同的社会动态。
- SS-SOM流程生成的地理聚类比邮编等行政边界更能反映当地社会规范和态度。
- 该方法使社会环境暴露的评估更加细致和准确,这对研究与歧视相关的健康差异至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。