[论文解读] Improving the Accessibility of Scientific Documents: Current State, User Needs, and a System Solution to Enhance Scientific PDF Accessibility for Blind and Low Vision Users
本文提出 SciA11y,一种自动化系统,利用机器学习将难以访问的科学PDF转换为语义丰富、可访问的HTML文档,以提升盲人及低视力(BLV)用户在导航与可读性方面的体验。该系统在87%的案例中实现了高质量渲染,并在一项定性研究中展现出极高的用户接受度,所有参与者均表示有意将其作为主要工作流程使用。
The majority of scientific papers are distributed in PDF, which pose challenges for accessibility, especially for blind and low vision (BLV) readers. We characterize the scope of this problem by assessing the accessibility of 11,397 PDFs published 2010--2019 sampled across various fields of study, finding that only 2.4% of these PDFs satisfy all of our defined accessibility criteria. We introduce the SciA11y system to offset some of the issues around inaccessibility. SciA11y incorporates several machine learning models to extract the content of scientific PDFs and render this content as accessible HTML, with added novel navigational features to support screen reader users. An intrinsic evaluation of extraction quality indicates that the majority of HTML renders (87%) produced by our system have no or only some readability issues. We perform a qualitative user study to understand the needs of BLV researchers when reading papers, and to assess whether the SciA11y system could address these needs. We summarize our user study findings into a set of five design recommendations for accessible scientific reader systems. User response to SciA11y was positive, with all users saying they would be likely to use the system in the future, and some stating that the system, if available, would become their primary workflow. We successfully produce HTML renders for over 12M papers, of which an open access subset of 1.5M are available for browsing at https://scia11y.org/
研究动机与目标
- 评估2010–2019年间发布的11,397篇科学PDF的可访问性,发现仅有2.4%满足全部可访问性标准。
- 识别盲人及低视力(BLV)研究人员在使用屏幕阅读器阅读科学论文时面临的关键挑战。
- 设计并实现 SciA11y,一种自动化系统,可从PDF中提取语义内容,并将其渲染为适合BLV用户使用的可访问、可导航的HTML。
- 通过专家评分评估渲染质量以及对六名BLV学者进行的定性用户研究,评估该系统的有效性。
- 基于用户反馈,提炼出五项可操作的设计建议,以指导未来可访问性科学阅读器系统的设计。
提出的方法
- 该系统使用多个机器学习模型,从科学PDF中提取文本、数学表达式、表格、图表及文档结构。
- 它将内容重构为语义结构化的HTML格式,包含带标签的标题、合理的阅读顺序以及为屏幕阅读器优化的导航功能。
- 团队对100个随机抽取的HTML渲染结果进行了专家评分,以评估其忠实度与可读性,分类为无问题、部分问题或存在多个问题。
- 开展了一项定性用户研究,对象为六名BLV研究人员,涉及对原生PDF与SciA11y渲染的HTML版本的屏幕导航操作。
- 研究采用“自言自语”法与结构化访谈提纲,收集用户关于工作流程、痛点以及系统实用性的反馈。
- 该系统已用于渲染超过1200万篇论文,其中150万篇开放获取版本已通过 scia11y.org 公开提供。
实验结果
研究问题
- RQ1在多个学科领域与出版年份中,科学PDF的可访问性现状如何?
- RQ2盲人及低视力研究人员在使用屏幕阅读器阅读科学论文时面临哪些具体挑战?
- RQ3像SciA11y这样的自动化系统在多大程度上能够提升科学PDF对BLV用户的可访问性与可用性?
- RQ4与原始PDF相比,BLV研究人员如何看待机器转换生成的HTML版本在可用性与价值方面的表现?
- RQ5基于用户反馈,可以总结出哪些设计原则,以指导未来可访问性科学阅读器系统的发展?
主要发现
- 在2010–2019年间抽取的11,397篇科学PDF中,仅有2.4%满足所有定义的可访问性标准,表明可访问性问题普遍存在。
- 根据专家评分,SciA11y生成的87%的HTML渲染结果无问题或仅有轻微可读性问题。
- 用户研究中的六名参与者均表示未来可能会使用SciA11y,部分人甚至表示其可能成为其主要阅读工作流程。
- 参与者指出了PDF中的关键痛点,包括非线性阅读顺序、缺少结构标签以及未标注的图表,而SciA11y成功缓解了这些问题。
- 用户研究得出了五项具体的设计建议,适用于可访问性科学阅读器系统,包括增强导航功能、语义标签支持以及对数学内容的处理。
- 该系统已成功渲染超过1200万篇科学论文,其中150万篇开放获取版本可通过 scia11y.org 公开浏览。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。