Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Accessibility of Scientific Documents: Current State, User Needs, and a System Solution to Enhance Scientific PDF Accessibility for Blind and Low Vision Users

Lucy Lu Wang, Isabel Cachola|arXiv (Cornell University)|2021. 04. 30.
Digital Accessibility for Disabilities인용 수 16
한 줄 요약

이 논문은 빛이 약한 시력이 있는 사용자(Blind and Low Vision, BLV)의 탐색성과 가독성을 향상시키기 위해 기계학습을 활용해 접근성 없는 과학적 PDF를 의미적으로 풍부한 접근 가능한 HTML 문서로 자동 변환하는 SciA11y라는 시스템을 제안한다. 이 시스템은 87%의 경우에서 높은 품질의 렲더링을 달성했으며, 정성적 연구에서 강한 사용자 수용도를 보였으며, 모든 참가자가 시스템을 주된 작업 워크플로우로 사용할 의향을 보였다.

ABSTRACT

The majority of scientific papers are distributed in PDF, which pose challenges for accessibility, especially for blind and low vision (BLV) readers. We characterize the scope of this problem by assessing the accessibility of 11,397 PDFs published 2010--2019 sampled across various fields of study, finding that only 2.4% of these PDFs satisfy all of our defined accessibility criteria. We introduce the SciA11y system to offset some of the issues around inaccessibility. SciA11y incorporates several machine learning models to extract the content of scientific PDFs and render this content as accessible HTML, with added novel navigational features to support screen reader users. An intrinsic evaluation of extraction quality indicates that the majority of HTML renders (87%) produced by our system have no or only some readability issues. We perform a qualitative user study to understand the needs of BLV researchers when reading papers, and to assess whether the SciA11y system could address these needs. We summarize our user study findings into a set of five design recommendations for accessible scientific reader systems. User response to SciA11y was positive, with all users saying they would be likely to use the system in the future, and some stating that the system, if available, would become their primary workflow. We successfully produce HTML renders for over 12M papers, of which an open access subset of 1.5M are available for browsing at https://scia11y.org/

연구 동기 및 목표

  • 2010~2019년 동안 출판된 11,397편의 과학적 PDF의 접근성 수준을 평가하여, 전면 접근성 기준을 충족하는 비율이 오직 2.4%에 불과함을 확인한다.
  • 스크린 리더를 사용할 때 빛이 약한 시력이 있는 연구자들이 과학 논문을 읽는 데 겪는 주요 과제를 특정한다.
  • 과학적 PDF에서 의미 있는 콘텐츠를 추출하고, BLV 사용자를 위한 접근 가능하고 탐색 가능한 HTML로 렌더링하는 자동화된 시스템인 SciA11y를 설계 및 구현한다.
  • 전문가 평가를 통한 렌더링 품질 평가와 6명의 BLV 학자들을 대상으로 한 정성적 사용자 연구를 통해 시스템의 효과성을 평가한다.
  • 사용자 피드백을 바탕으로 향후 접근 가능한 과학 독서 시스템 개발을 지침으로 삼을 수 있는 다섯 가지 실행 가능한 설계 원칙을 도출한다.

제안 방법

  • 시스템은 과학적 PDF에서 텍스트, 수학적 표현, 표, 그림, 문서 구조를 추출하기 위해 다수의 기계학습 모델을 활용한다.
  • 팀은 스크린 리더에 최적화된 제목 레이블, 독서 순서, 탐색 기능을 갖춘 의미적으로 구조화된 HTML 형식으로 콘텐츠를 재구성한다.
  • 100개의 무작위로 추출된 HTML 렌더링에 대해 전문가 평가를 수행하여 충실도와 가독성 수준을 평가하였으며, 문제 없음, 일부 문제, 다수 문제로 분류하였다.
  • 6명의 BLV 연구자들을 대상으로 정성적 사용자 연구를 수행하였으며, 원본 PDF와 SciA11y로 렌더링된 HTML 버전을 모두 사용하여 화면 기반 탐색을 실시하였다.
  • 사용자 연구는 생각을 말하는 방식과 구조화된 인터뷰 가이드를 사용하여 워크플로우, 애로점, 시스템의 실용성에 대한 피드백을 유도하였다.
  • 시스템은 1,200만 편 이상의 논문을 렌더링하였으며, 그 중 150만 편의 오픈 액세스 버전은 scia111y.org에서 공개 브라우징이 가능하도록 제공되었다.

실험 결과

연구 질문

  • RQ1다양한 분야와 출판 연도에 걸쳐 과학적 PDF의 접근성 현황은 어떠한가?
  • RQ2스크린 리더를 사용할 때 빛이 약한 시력이 있는 연구자들이 과학 논문을 읽는 데 겪는 특정 과제는 무엇인가?
  • RQ3SciA11y와 같은 자동화된 시스템이 BLV 사용자들에게 과학적 PDF의 접근성과 사용성에 얼마나 기여할 수 있는가?
  • RQ4원본 PDF와 비교해 기계 기반 HTML 버전의 사용성과 가치를 BLV 연구자들이 어떻게 평가하는가?
  • RQ5사용자 피드백을 바탕으로 향후 접근 가능한 과학 독서 시스템 개발을 위한 설계 원칙은 무엇인가?

주요 결과

  • 2010~2019년 동안 샘플링된 11,397편의 과학적 PDF 중 전면 접근성 기준을 충족하는 비율은 오직 2.4%에 불과하여 광범위한 접근성 결여를 시사한다.
  • 전문가 평가에 따르면 SciA11y가 생성한 HTML 렌더링 중 87%는 문제 없음 또는 경미한 가독성 문제만을 보였다.
  • 사용자 연구에 참여한 6명의 참가자 전원이 향후 SciA11y를 사용할 가능성이 높다고 보고하였으며, 일부 참가자는 이를 주된 독서 워크플로우로 삼을 수 있을 것이라고 언급했다.
  • 참가자들은 PDF에서 비선형 독서 순서, 구조 태그 누락, 그림 레이블 미기입 등의 주요 고통 요소를 지적하였으며, 이는 SciA11y가 성공적으로 완화하였다.
  • 사용자 연구를 통해 접근 가능한 과학 독서 시스템을 위한 다섯 가지 구체적인 설계 권고안을 도출하였으며, 이는 향상된 탐색 기능, 의미적 레이블링, 수학적 콘텐츠 지원을 포함한다.
  • 시스템은 1,200만 편 이상의 과학 논문을 성공적으로 렌더링하였으며, 그 중 150만 편의 오픈 액세스 버전이 scia11y.org에서 공개 브라우징이 가능하도록 제공되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.