[논문 리뷰] AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments
AgentClinic 은 시뮬레이션 임상 환경에서 AI 에이전트를 평가하기 위한 오픈 소스 멀티모달 및 대화 기반 벤치마크를 제공하며 진단 정확성, 편향 및 인간이 판단한 현실성을 분석합니다.
Evaluating large language models (LLM) in clinical scenarios is crucial to assessing their potential clinical utility. Existing benchmarks rely heavily on static question-answering, which does not accurately depict the complex, sequential nature of clinical decision-making. Here, we introduce AgentClinic, a multimodal agent benchmark for evaluating LLMs in simulated clinical environments that include patient interactions, multimodal data collection under incomplete information, and the usage of various tools, resulting in an in-depth evaluation across nine medical specialties and seven languages. We find that solving MedQA problems in the sequential decision-making format of AgentClinic is considerably more challenging, resulting in diagnostic accuracies that can drop to below a tenth of the original accuracy. Overall, we observe that agents sourced from Claude-3.5 outperform other LLM backbones in most settings. Nevertheless, we see stark differences in the LLMs' ability to make use of tools, such as experiential learning, adaptive retrieval, and reflection cycles. Strikingly, Llama-3 shows up to 92% relative improvements with the notebook tool that allows for writing and editing notes that persist across cases. To further scrutinize our clinical simulations, we leverage real-world electronic health records, perform a clinical reader study, perturb agents with biases, and explore novel patient-centric metrics that this interactive environment firstly enables.
연구 동기 및 목표
- 정적 QA 벤치마크를 넘어서 순차적이고 상호작용적인 임상 의사결정에서 AI 성능 평가를 자극한다.
- 환자, 의사, 측정, 중재자 에이전트를 사용하는 공개 벤치마크(AgentClinic-MedQA 및 AgentClinic-NEJM)를 제공한다.
- 의사 및 환자 에이전트에 인지적 및 암시적 편향을 내재시켜 진단 및 환자 인식에 미치는 영향을 연구한다.
- 다른 LLM들이 의사 에이전트로서의 성능과 환자 언어 모델이 결과에 미치는 영향을 평가한다.
- 에이전트 상호작용에서 현실감과 공감을 평가하기 위한 인간 임상의 주석을 제공한다.
제안 방법
- 역할별 프롬프트와 구조화된 시나리오 데이터에 접근 권한을 가진 네 가지 언어 에이전트를 만든다(환자, 의사, 측정, 중재자).
- USMLE 유래 질문(MedQA)과 NEJM 사례를 사용하여 의사-환자 대화를 위한 OSCE 유사 구조화 JSON 시나리오를 구축한다.
- 의사 및 환자 에이전트를 위한 편향 프롬프트(인지적 및 암시적)를 도입하고 정확성과 환자 인식에 미치는 영향을 측정한다.
- 다른 LLM으로 단일 모달 대화(AgentClinic-MedQA)와 멀티모달 이미지+대화(AgentClinic-NEJM) 설정을 평가한다.
- 정확도 및 인식 지표를 범주로 GPT-4와 Mixtral-8x7B를 비교하는 편향 분석을 수행한다.
- 비정형 의사 출력의 해석과 진단의 정확성을 판단하기 위해 중재자를 포함한다.

실험 결과
연구 질문
- RQ1최신 LLM이 AgentClinic-MedQA에서 의사-환자 대화로 진단하는 능력은 얼마나 뛰어난가?
- RQ2의사 및 환자 에이전트의 인지적 및 암시적 편향이 진단 정확도와 환자 인식에 어떤 영향을 미치는가?
- RQ3환자 에이전트의 기본 언어 모델이 진단 성공과 상호작용 역학에 영향을 미치는가?
- RQ4제한된 대화 턴과 과도한 대화 턴이 AgentClinic에서 의사의 진단 정확도에 미치는 영향은 무엇인가?
- RQ5멀티모달 이미지 데이터(AgentClinic-NEJM)가 텍스트 전용 대화에 비해 진단에 미치는 영향은 어디까지인가?
주요 결과
- GPT-4는 AgentClinic-MedQA에서 52% 정확도; GPT-4o 38%; Mixtral-8x7B 37%; Llama 3 70B-instruct 30%; Llama 2 70B-chat 9%.
- AgentClinic-NEJM 멀티모달 작업에서 이미지를 초기 제공하면 GPT-4o가 47% 정확도를 달성하는 반면, GPT-4-turbo와 GPT-4-vision-preview는 각각 27%에 도달한다; 요청 시 이미지를 제공하면 정확도가 더 감소한다 (GPT-4o 27%, GPT-4-turbo 20%, GPT-4-vision-preview 13%).
- 편향 도입은 의사 및 환자의 진단 정확도를 낮추고 환자의 협조, 자신감, 추후 상담 의향을 떨어뜨리며; GPT-4는 Mixtral-8x7B에 비해 더 작은 정확도 하락을 보인다.
- 환자 에이전트의 언어 모델이 진단 성공에 결정적으로 영향을 미치며, 모델 간 상호작용(의사 대 환자)은 추가적인 도전을 야기할 수 있다.
- 제한된(N=10–15) 또는 과도한(N=25–30) 상호작용 턴도 균형 잡힌 20회 턴 설정에 비해 진단 정확도를 떨어뜨린다.
- 인간 임상의 평가는 현실감과 공감을 보통으로 평가했다(의사 6.2/10, 환자 6.7/10, 측정 6.3/10, 공감 5.8/10).
- AgentClinic-MedQA 정확도는 MedQA 점수만으로 강하게 예측되지 않으며, 대화 기반 임상 추론의 복잡성을 강조한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.