Skip to main content
QUICK REVIEW

[논문 리뷰] ExperienceWeaver: Optimizing Small-sample Experience Learning for LLM-based Clinical Text Improvement

Ziyan Xiao, Yinghao Zhu|arXiv (Cornell University)|2026. 01. 31.
Artificial Intelligence in Healthcare and Education인용 수 0
한 줄 요약

ExperienceWeaver는 다차원 임상 피드백을 오류별 팁과 고수준 전략으로 변환하는 계층적 경험 증류 프레임워크를 도입하여 소샘플 LLM 기반 임상 텍스트 개선을 가능하게 하고 실험에서 여러 SOTA 모델을 능가합니다.

ABSTRACT

Clinical text improvement is vital for healthcare efficiency but remains difficult due to limited high-quality data and the complex constraints of medical documentation. While Large Language Models (LLMs) show promise, current approaches struggle in small-sample settings: supervised fine-tuning is data-intensive and costly, while retrieval-augmented generation often provides superficial corrections without capturing the reasoning behind revisions. To address these limitations, we propose ExperienceWeaver, a hierarchical framework that shifts the focus from data retrieval to experience learning. Instead of simply recalling past examples, ExperienceWeaver distills noisy, multi-dimensional feedback into structured, actionable knowledge. Specifically, error-specific Tips and high-level Strategies. By injecting this distilled experience into an agentic pipeline, the model learns "how to revise" rather than just "what to revise". Extensive evaluations across four clinical datasets demonstrate that ExperienceWeaver consistently improves performance, surpassing state-of-the-art models such as Gemini-3 Pro in small-sample settings.

연구 동기 및 목표

  • 데이터 부족 및 이질적인 임상의 기대치 하에서 임상 텍스트 개선 필요성의 동기를 제시합니다.
  • 회수 기반 방법에서 증류 기반 경험 학습으로의 패러다임 전환을 제안합니다.
  • 실행 가능한 Tip과 고수준 전략을 산출하는 두 단계의 경험 연계 프로세스를 개발합니다.
  • 증류된 경험을 오류 탐지, 수정 및 자체 비판을 위한 에이전트적 다중 에이전트 수정 파이프라인에 통합합니다.
  • 다중 임상 데이터 세트에 걸친 효과를 입증하고 소샘플 설정에서 강력한 베이스라인과 비교합니다.

제안 방법

  • Two-stage Experience Weaver: 1단계는 LLM의 안내에 따라 Experience Abstraction 및 Experience Combination을 통해 원시 피드백을 구조화된 경험으로 증류합니다.
  • 2단계는 증류된 경험을 두 계층으로 재구성합니다: 각 단계(탐지, 수정, 자체 비판)에 대한 지지 사례가 있는 오류-specific Tips와 기능적 Strategies.
  • Experience Retriever가 계층화된 경험을 에이전트 파이프라인에 주입하되 정보성 및 간결성의 균형을 맞추기 위한 최대 Tip 수 제한을 둡니다.
  • 에이전트적 프레임워크는 공유 메모리, RAG, 그리고 Experience Retriever를 통해 조정되는 오류 탐지, 수정, 자체 비판 에이전트가 포함된 다중 에이전트 ReAct-스타일 구성을 따릅니다.
  • 피드백은 다차원적(정확성, 형식, 의미성, 가독성)이며 평가 및 가이드 프롬프트 모두에 정보를 제공합니다.
  • 하이퍼파라미터(Ng: 그룹 크기, τe: 오류 빈도 임계값, τt: 최대 검색 팁 수)가 직조 및 검색의 세분성과 효율성을 제어합니다.

실험 결과

연구 질문

  • RQ1임상 텍스트 품질을 평가하기 위한 LLM-저울(LLM-as-a-Judge) 프레임워크의 신뢰성은 얼마나 되며 어떤 기본 모델이 가장 안정적인가요?
  • RQ2ExperienceWeaver가 다차원적이고 소샘플 피드백을 임상 텍스트 수정 품질을 향상시키는 실행 가능한 경험으로 전환할 수 있나요?
  • RQ3다양한 데이터 소스와 언어에서 소샘플 임상 텍스트 처리에 대해 ExperienceWeaver의 효과는 얼마나 되나요?
  • RQ4피드백 양과 직조의 세분성과 같은 어떤 요인이 ExperienceWeaver 성능에 영향을 미치나요?

주요 결과

  • ExperienceWeaver는 Gemini-3 Pro 및 GPT-5.1을 포함한 강력한 베이스라인과 비교했을 때 네 가지 임상 데이터셋에서 일관되게 텍스트 품질을 향상시킵니다.
  • 데이터셋 전반의 5점 리커트 척도에서의 평균 개선은 각각 0.794(English Chest X-ray), 0.456(Chinese Abdominal CT), 0.412(Discharge), 0.137(Clinical Free Text)입니다.
  • 현장(real-world) 검증에서 직조된 경험을 도입하면 오류 탐지 지표(정확도, 정밀도, 재현율)가 각각 최대 20.4%, 16.3%, 28.6% 향상되었습니다.
  • 소샘플 검증 작업에서 중간 길이의 팁(τ = 3)이 더 높은 안정성을 보였습니다.
  • 이 방법은 여러 단일-샷 LLM 베이스라인과 RAG 기반 방법을 능가하여 소샘플 임상 텍스트 개선에서 높은 성능을 입증했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.