[论文解读] Twitter User Geolocation using Deep Multiview Learning
本文提出 MENET,一种深度多视图神经网络,整合了文本、网络和元数据特征以实现 Twitter 用户地理定位,在 GeoText 和 UTGeo2011 数据集上实现了 SOTA 性能,州级准确率为 64.8%,且距离误差指标有所提升。
Predicting the geographical location of users on social networks like Twitter is an active research topic with plenty of methods proposed so far. Most of the existing work follows either a content-based or a network-based approach. The former is based on user-generated content while the latter exploits the structure of the network of users. In this paper, we propose a more generic approach, which incorporates not only both content-based and network-based features, but also other available information into a unified model. Our approach, named Multi-Entry Neural Network (MENET), leverages the latest advances in deep learning and multiview learning. A realization of MENET with textual, network and metadata features results in an effective method for Twitter user geolocation, achieving the state of the art on two well-known datasets.
研究动机与目标
- 解决在标注地理标签数据有限且用户内容存在噪声的条件下,Twitter 用户地理定位的挑战。
- 通过统一多种数据源,克服仅依赖内容或仅依赖网络方法的局限性。
- 开发一种通用且可扩展的深度学习框架,能够整合多种特征类型以提升地理定位准确率。
- 在区域级、州级和基于坐标的地理定位任务的标准基准上实现 SOTA 性能。
提出的方法
- 提出 MENET,一种多输入神经网络架构,分别处理四种不同的特征视图:TF-IDF 文本特征、用于微博语义的 doc2vec 嵌入、用于社交网络拓扑的 node2vec 嵌入,以及基于时间戳的元数据。
- 使用深度神经网络独立地从每个特征视图学习分层表征,随后在共享分类头中进行融合。
- 应用特征工程,包括 TF-IDF(GeoText 为最小频率 40,UTGeo2011 为 500),以及 300 维的 node2vec 和 doc2vec 嵌入。
- 使用 ADAM 优化器进行模型训练,学习率为 0.0001,输出层应用 L2 正则化(λ = 0.1)。
- 多视图特征的融合使模型能够捕捉来自内容、用户互动和时间模式的互补信号。
- 使用 Haversine 公式计算距离误差,并报告包括平均/中位数距离误差和 accuracy@161km 在内的指标。
实验结果
研究问题
- RQ1统一的深度学习模型能否有效结合文本、网络和元数据特征,以提升 Twitter 用户地理定位准确率?
- RQ2在地理定位预测中,多视图特征(内容、社交图谱、时间戳)的整合与单模态方法相比表现如何?
- RQ3在标准基准上,使用深度神经网络的多视图学习在多大程度上优于现有 SOTA 方法?
- RQ4该模型在不同地理定位任务中的表现如何:区域分类、州级分类和坐标回归?
- RQ5使用行政边界与基于数据的地理划分对模型泛化能力和误差指标有何影响?
主要发现
- 在 GeoText 数据集上,MENET 在美国州级分类中达到 64.8% 的准确率,相比文献 [4] 中的 SOTA 方法(41%)提升了 23.8 个百分点。
- 在区域分类任务中,MENET 相较于文献 [4] 中的 SOTA 方法,准确率提升了 9%,在 GeoText 数据集上达到 59.1%。
- 在地理坐标预测任务中,MENET 在 GeoText 上实现平均距离误差 474 公里,中位数误差 157 公里,平均误差优于 [8],且 accuracy@161km 与之持平。
- 在 UTGeo2011 数据集上,MENET 在所有对比方法中实现了最低的平均距离误差,尽管 [24] 和 [8] 因优化了地图划分策略,在其他指标上表现更优。
- 模型性能受限于其对行政边界的依赖,而非基于数据的聚类,表明通过自适应划分方法仍有进一步提升空间。
- 消融实验确认,结合全部四种特征类型(文本、语义、网络、时间)可获得最高性能,验证了多视图学习方法的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。