[论文解读] TimeMachine: Entity-centric Search and Visualization of News Archives
TimeMachine 是一个基于网络的工具,通过自然语言处理(NLP)和信息检索技术,支持对大规模新闻档案进行交互式、以实体为中心的搜索与可视化。它从数百万篇新闻文章中提取并索引实体、引语及共现关系,使用户能够通过时间排序的实体档案和动态的、基于力导向算法的关联人物网络,探索不断演变的新闻事件。
We present a dynamic web tool that allows interactive search and visualization of large news archives using an entity-centric approach. Users are able to search entities using keyword phrases expressing news stories or events and the system retrieves the most relevant entities to the user query based on automatically extracted and indexed entity profiles. From the computational journalism perspective, TimeMachine allows users to explore media content through time using automatic identification of entity names, jobs, quotations and relations between entities from co-occurrences networks extracted from the news articles. TimeMachine demo is available at http://maquinadotempo.sapo.pt/
研究动机与目标
- 为应对快速扩张的新闻档案带来的导航挑战,通过基于实体的查询,使记者和研究人员能够基于时间探索媒体内容。
- 开发一个可扩展的系统,自动从大规模新闻语料中提取并索引实体、引语和关系。
- 提供一个交互式、用户友好的界面,用于可视化新闻事件和公众人物随时间的演变过程。
- 通过基于关键词的查询和时间过滤的实体网络,支持对媒体内容的动态探索。
- 通过整合 NLP、文本挖掘和信息检索技术,提升计算新闻学水平,实现更优的新闻分析。
提出的方法
- 该系统使用新闻清洗流水线,从原始 HTML/XML 新闻文件中去除冗余内容。
- 基于条件随机场(CRF)的 NERD 模块利用语言模式和职位描述,通过在 50,000 篇新闻样本上采用自举法训练,识别并消歧实体提及。
- 提取包含实体提及的句子片段(entity snippets),并将其拼接成实体文档以供索引。
- 实体索引捕获实体与术语之间的共现频率,支持基于查询关键词或短语的时间感知检索。
- 通过语言模式匹配提取引语,以丰富实体档案内容。
- 通过在同一篇文章中出现的实体之间增加边权重,构建共现网络,并使用 Sigma.js 和力导向算法进行可视化。
实验结果
研究问题
- RQ1如何通过以实体为中心的查询而非基于关键词的搜索,有效探索大规模新闻档案?
- RQ2使用共现网络和时间过滤对新闻事件演变过程的可解释性有何影响?
- RQ3自动实体抽取与消歧技术在新闻报道和档案研究场景中是否能达到足够的准确度?
- RQ4基于力导向算法的实体网络可视化在多大程度上有助于用户理解媒体叙事随时间的演变?
- RQ5在标注数据有限的新闻文本中,自举学习方法在多大程度上能提升 NER 的性能?
主要发现
- 该系统处理了来自葡萄牙语新闻源的超过 1,200 万篇新闻文章,涵盖一个 20 年的档案库和来自 50 家报纸的实时新闻流。
- 动态生成的实体档案包含姓名、职业、新闻片段、引语和相关实体,支持基于时间的导航。
- 实体检索系统支持直接姓名查询(如“Cristiano Ronaldo”)和语义查询(如“eurozone crisis”),以检索相关实体。
- 使用 Sigma.js 和力导向布局的交互式共现网络可视化中,节点大小和边宽分别反映提及频率和共现强度。
- 颜色编码的节点代表不同新闻主题,增强了实体关系的主题解读能力。
- 系统支持时间跨度过滤,允许用户在特定日期范围内探索实体网络,观察叙事演变过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。