[论文解读] COVID-19: An exploration of consecutive systemic barriers to pathogen-related data sharing during a pandemic
本研究识别出在大流行期间与病原体相关数据共享的四个顺序性系统性障碍——知晓数据存在、获取数据、确保数据质量以及共享研究成果——这些障碍因人力处理能力有限而加剧。研究呼吁建立计算可读、符合FAIR原则的数据基础设施以及宽松的再利用政策,以防止未来大流行响应延迟。
In 2020, the COVID-19 pandemic resulted in a rapid response from governments and researchers worldwide. As of March 2021, there have been over 122 million confirmed cases, with over 2.7 million people dying as a result of COVID-19. Despite this staggering toll, those who work with pandemic-relevant data often face significant systemic barriers to accessing, sharing or re-using this data. In this paper we report preliminary results for an in-progress qualitative study, where we interviewed data professionals working with COVID-19-relevant data types including social media, mobility, viral genome, testing, infection, hospital admission, and deaths. These data types are variously used for pandemic spread modelling, healthcare system strain awareness, and devising therapeutic treatments for COVID-19. Barriers to data sharing include cost of access to data (primarily certain healthcare sources and mobility data from mobile phone carriers), human throughput bottlenecks, unclear pathways to request access to data, unnecessarily strict access controls and data re-use policies, unclear data provenance, inability to link separate datasources that could collectively create a more complete picture, poor metadata standards, and a lack of computer-suitable data formats.
研究动机与目标
- 调查在大流行期间研究人员之间有效共享数据所面临的系统性障碍。
- 理解技术、机构和地缘政治因素如何阻碍数据访问、质量和再利用。
- 识别包括私有和非私有健康数据在内的各类数据中反复出现的挑战。
- 通过记录COVID-19大流行期间的真实障碍和研究人员经验,为政策制定提供依据。
- 倡导建立计算化数据共享管道和宽松的再利用政策,以增强未来大流行的准备能力。
提出的方法
- 对从事COVID-19相关数据的数据专业人员开展远程、半结构化定性访谈。
- 使用主题分析法分析访谈记录,识别重复出现的主题、障碍和成功因素。
- 将障碍归类为一个顺序框架:知晓数据存在、获取数据、确保数据质量、共享研究成果。
- 在整个数据使用各阶段均识别出一个持续存在的第五个障碍——人力处理能力。
- 通过匿名参与者引述和实际用例说明障碍,尤其在隐私敏感和地缘政治受限的环境中。
- 将研究发现与FAIR数据原则及政策建议对齐,以指导未来数据基础设施的设计。
实验结果
研究问题
- RQ1研究人员在大流行期间访问和再利用病原体相关数据时,面临哪些系统性障碍?
- RQ2数据访问延迟和数据质量差如何影响大流行建模和政策决策的及时性与准确性?
- RQ3机构、技术和地缘政治因素在多大程度上阻碍了研究和公共卫生系统之间的数据共享?
- RQ4有限的数据处理人力容量如何在数据使用的各个阶段成为瓶颈?
- RQ5为实现在未来大流行中实现高效、可计算和可重用的数据共享,需要哪些技术和政策改进?
主要发现
- 研究人员经常因漫长的审批流程和受控访问系统而面临数据获取延迟,即使在大流行的急性阶段也是如此。
- 大量研究人员报告称,数据质量差(如格式不一致或元数据缺失)需要大量手动清洗才能进行分析。
- 许多研究人员并不知晓现有数据源的存在,表明尽管大流行响应紧迫,数据发现机制仍存在严重失效。
- 地缘政治性数据压制和各国在数据共享政策上的不一致,造成了跨司法管辖区的数据再利用重大障碍。
- 人力处理能力是持续存在的瓶颈,研究人员常常因数据访问请求量过大和行政负担过重而不堪重负。
- 尽管FAIR原则已存在,但很少有数据系统具备计算可读性,仍需人工干预,从而增加了出错风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。