Skip to main content
QUICK REVIEW

[논문 리뷰] EndoExtract: Co-Designing Structured Text Extraction from Endometriosis Ultrasound Reports

Haiyi Li, Yiyang Zhao|arXiv (Cornell University)|2026. 01. 26.
Radiology practices and education인용 수 0
한 줄 요약

EndoExtract는 임상의와 공동 설계된 온프레미스 LLM 기반 시스템으로 자궁내막증 초음파 보고서를 구조화된 데이터로 추출하며, 해석적 필드 검토, 자동 증거 하이라이팅, 배치 속도 검증을 우선합니다.

ABSTRACT

Endometriosis ultrasound reports are often unstructured free-text documents that require manual abstraction for downstream tasks such as analytics, machine learning model training, and clinical auditing. We present extbf{EndoExtract}, an on-premise LLM-powered system that extracts structured data from these reports and surfaces interpretive fields for human review. Through contextual inquiry with research assistants, we identified key workflow pain points: asymmetric trust between numerical and interpretive fields, repetitive manual highlighting, fatigue from sustained comparison, and terminology inconsistency across radiologists. These findings informed an interface that surfaces only interpretive fields for mandatory review, automatically highlights source evidence within PDFs, and separates batch extraction from human-paced verification. A formative workshop revealed that extbf{EndoExtract} supports a shift from field-by-field data entry to supervisory validation, though participants noted risks of over-skimming and challenges in managing missing data.

연구 동기 및 목표

  • 맥락적 탐구를 통해 자궁내막증 보고서 추상화의 워크플로우 문제점을 특징화한다.
  • 임상 데이터 검토 요구에 맞춘 온프레미스 LLM 기반 추출 시스템을 개발한다.
  • 개별 필드 입력에서 감독 검증으로 데이터 입력을 전환하는 인터페이스를 설계한다.
  • 검증을 지원하기 위해 자동 증거 하이라이트와 의미적 표준화를 가능하게 한다.
  • 도메인 전문가를 대상으로 형성적 워크숍을 통해 채택 여부와 워크플로 영향력을 평가한다.

제안 방법

  • 신뢰 비대칭성과 검증 관행을 식별하기 위해 연구 보조원과의 맥락적 탐구.
  • 프라이버시를 위해 Ollama를 통해 온프레미스에 배치된 gpt-oss-20b 백엔드를 활용한 EndoExtract 개발.
  • 필수적 인간 검토로의 다섯 개 해석 필드만 노출하는 선택적 검토 표면을 제공하는 한편 150개 이상 숫자 필드를 자동화한다.
  • 확인을 지원하기 위해 PDFs 내 소스 증거의 자동 하이라이트.
  • 최대 5,000 PDFs의 배치 처리와 속도 조절된 검토 및 변경 추적.
  • 인지 부하를 줄이고 일관성을 높이기 위한 용어의 의미론적 표준화.

실험 결과

연구 질문

  • RQ1워크플로우 요인과 신뢰 비대칭이 자궁내막증 초음파 보고서의 데이터 추출에 어떤 영향을 미치는가?
  • RQ2선택적 검토 표면을 갖춘 온프레미스 LLM 기반 시스템이 임상 텍스트 추상화의 효율성을 개선하고 데이터 품질을 유지할 수 있는가?
  • RQ3증거 하이라이팅과 배치 속도 검증이 추출된 데이터의 감독 검증을 더 신뢰성 있게 지원하는가?
  • RQ4임상 정보 추출에서 검증 중심의 인간-AI 협업을 가장 잘 지원하는 디자인 원칙은 무엇인가?
  • RQ5AI 보조 임상 데이터 추상화 인터페이스에 대한 인식된 위험성과 채택 장벽은 무엇인가?

주요 결과

  • 신뢰 비대칭은 해석적 필드에 대한 선택적 검토를 촉진하는 반면 숫자 필드는 자동화한다.
  • 자동 증거 하이라이트는 반복적인 수동 주석 작성을 제거하고 검증을 지원한다.
  • 배치 처리는 속도 조절된 검토를 가능하게 하고 추적성 손실 없이 피로를 감소시킨다.
  • 의미론적 표준화는 용어의 변형을 줄이고 하류의 일관성을 개선한다.
  • 형성적 워크숍은 과도한 훑어보기와 데이터 누락에 주의하며 데이터 입력에서 감독 검증으로의 전환을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.