Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing LLMs for Impression Generation in Radiology Reports through a Multi-Agent System

Fang Zeng, Zhiliang Lyu|arXiv (Cornell University)|2024. 12. 06.
Semantic Web and Ontologies인용 수 4
한 줄 요약

이 논문은 검색 기반 에이전트, 방사선과 전문의 에이전트, 검토자 에이전트를 통합하여 영상 소견 생성을 향상시키는 다에이전트 LLM 프레임워크인 RadCouncil을 제안한다. 반복 피드백과 검색 증강 생성을 통해 단일 에이전트 모델에 비해 진단 정확도, 스타일 일관성, 명확도가 향상되며, GPT-4 평가를 통한 상당한 품질 향상이 확인되었다.

ABSTRACT

This study introduces "RadCouncil," a multi-agent Large Language Model (LLM) framework designed to enhance the generation of impressions in radiology reports from the finding section. RadCouncil comprises three specialized agents: 1) a "Retrieval" Agent that identifies and retrieves similar reports from a vector database, 2) a "Radiologist" Agent that generates impressions based on the finding section of the given report plus the exemplar reports retrieved by the Retrieval Agent, and 3) a "Reviewer" Agent that evaluates the generated impressions and provides feedback. The performance of RadCouncil was evaluated using both quantitative metrics (BLEU, ROUGE, BERTScore) and qualitative criteria assessed by GPT-4, using chest X-ray as a case study. Experiment results show improvements in RadCouncil over the single-agent approach across multiple dimensions, including diagnostic accuracy, stylistic concordance, and clarity. This study highlights the potential of utilizing multiple interacting LLM agents, each with a dedicated task, to enhance performance in specialized medical tasks and the development of more robust and adaptable healthcare AI solutions.

연구 동기 및 목표

  • 단일 에이전트 LLM이 정확하고 일관된 영상 소견 생성에 한계를 보이는 문제, 특히 환각 현상과 스타일 일관성 문제를 해결하기 위해.
  • 검색, 생성, 동료 검토를 통합하여 임상 영상 방사선과 진료 흐름을 모방하는 확장성 있고 모듈화된 프레임워크를 개발하기 위해.
  • 검색 증강 생성과 다에이전트 피드백를 활용하여 진단 정밀도를 향상시키고 방사선 영상 보고서 기준에 맞는 스타일 일치를 도모하기 위해.
  • 다에이전트 시스템이 시간적 요소나 상태 관련 결론에서의 일관성 문제를 줄이는 데 얼마나 효과적인지 평가하기 위해.
  • 이 프레임워크가 방사선을 초월해 협업, 전문성, 검증이 필요한 다른 임상 기록 작업에 대해 강력하고 신뢰할 수 있으며 유연한 헬스케어 AI 응용 분야로 확장 가능한지 탐색하기 위해.

제안 방법

  • RadCouncil는 세 가지 전문화된 LLM 에이전트를 사용한다: 벡터 유사도를 활용해 데이터베이스에서 유사한 이전 보고서를 검색하는 검색 기반 에이전트.
  • 입력된 소견 항목과 검색된 예시 보고서를 기반으로 방사선과 전문의 에이전트가 소견을 생성하며, 이전 사례의 맥락을 활용한다.
  • 검토자 에이전트는 생성된 소견이 소견 내용과 일관된지 평가하며, 잘못된 '변함없음' 상태 기재와 같은 오류를 탐지하는 데 집중한다.
  • 시스템은 반복 피드백을 사용한다: 일관성이 없음을 감지하면 검토자 에이전트의 피드백에 따라 방사선과 전문의 에이전트가 소견을 재작성한다.
  • 프레임워크는 도메인 특화 지식과 방사선 보고서 관례에 대한 스타일 충실도를 향상시키기 위해 검색 증강 생성(Retrieval-Augmented Generation, RAG)을 통합한다.
  • 성능 평가는 BLEU, ROUGE, BERTScore 및 GPT-4를 통한 정성적 평가를 통해 이루어지며, 흉부 X-ray 보고서를 테스트 케이스로 사용한다.
Figure 1 : Diagram of the proposed RadCouncil framework, illustrating the interactions between the three agents, the report database, and the user.
Figure 1 : Diagram of the proposed RadCouncil framework, illustrating the interactions between the three agents, the report database, and the user.

실험 결과

연구 질문

  • RQ1다에이전트 LLM 프레임워크는 단일 에이전트 접근 방식에 비해 영상 소견 생성의 진단 정확도와 스타일 일관성 향상에 기여하는가?
  • RQ2전용 검토자 에이전트와 함께 검색 증강 생성을 통합할 경우 환각 현상과 일관성 문제 감소에 얼마나 효과적인가?
  • RQ3검토자 에이전트는 시간적 상태 변화와 관련된 오류, 특히 잘못된 '변함없음' 결론을 어느 정도 탐지하고 수정할 수 있는가?
  • RQ4역할 전문화가 이루어진 다에이전트 아키텍처는 의료 텍스트 생성의 신뢰성과 내구성 향상에 어떻게 기여하는가?
  • RQ5이 프레임워크는 협업, 전문성, 검증이 필요한 다른 임상 기록 작업으로 일반화될 수 있는가?

주요 결과

  • RadCouncil는 BLEU, ROUGE, BERTScore 등의 정량적 지표에서 단일 에이전트 기반 모델에 비해 뚜렷한 성능 향상을 보였으며, 더 나은 유창성과 관련성으로 이어졌다.
  • GPT-4 평가 결과, RadCouncil가 생성한 소견은 단일 에이전트 모델에 비해 임상적으로 더 정확하고 스타일 일관성이 뛰어나며 더 명확했다.
  • 검토자 에이전트는 상태 기재 오류가 포함된 다섯 건의 사례 중 네 건에서 일관성 문제를 성공적으로 탐지하고 수정했다. 특히 '변함없음' 결론 오류에 대해 유의미한 성과를 보였다.
  • 이전 비교 연구가 명시적으로 기재되어 있지 않은 경우, 검토자 에이전트는 '상태(Status)'와 관련된 일관성 문제를 탐지하지 못했으며, 이는 시간적 추론 능력 향상의 필요성을 시사한다.
  • 검색 증강 생성은 방사선 보고서 기준에 부합하는 스타일 일치를 향상시키고 진단 정밀도를 높였지만, 새로운 일관성 문제 위험도 유발했다.
  • 다에이전트 시스템은 전문화된 협업 에이전트를 활용해 환각 현상을 줄이고 의료 LLM 응용 분야의 신뢰성 향상을 위한 가능성을 입증했다.
Figure 2 : Example comparison of original impression generated by radiologist agent only vs. impression enhanced by report retriever agent.
Figure 2 : Example comparison of original impression generated by radiologist agent only vs. impression enhanced by report retriever agent.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.