[논문 리뷰] Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People
Apollo는 ApolloCorpora로 학습된 가벼운 다국어 의료 LLM(0.5B–7B)을 제안하여 영어, 중국어, 힌디어, 스페인어, 프랑스어, 아랍어를 커버하고, XMedBench를 평가에 도입하며, 프록시 튜닝이 개인적 의료 데이터를 미세 조정하지 않고도 더 큰 모델로 다국어 의료 역량을 확장할 수 있음을 보여준다.
Despite the vast repository of global medical knowledge predominantly being in English, local languages are crucial for delivering tailored healthcare services, particularly in areas with limited medical resources. To extend the reach of medical AI advancements to a broader population, we aim to develop medical LLMs across the six most widely spoken languages, encompassing a global population of 6.1 billion. This effort culminates in the creation of the ApolloCorpora multilingual medical dataset and the XMedBench benchmark. In the multilingual medical benchmark, the released Apollo models, at various relatively-small sizes (i.e., 0.5B, 1.8B, 2B, 6B, and 7B), achieve the best performance among models of equivalent size. Especially, Apollo-7B is the state-of-the-art multilingual medical LLMs up to 70B. Additionally, these lite models could be used to improve the multi-lingual medical capabilities of larger models without fine-tuning in a proxy-tuning fashion. We will open-source training corpora, code, model weights and evaluation benchmark.
연구 동기 및 목표
- 의사소통이 가능한 다국어 의료 능력을 영어, 중국어, 힌디어, 스페인어, 프랑스어, 아랍어의 여섯 개이 언어로 확장하여 의료 인공지능을 민주화한다.
- ApolloCorpora를 통해 고품질의 다국어 의료 데이터를 구축하고 언어 간 의학 지식을 평가하기 위한 평가 벤치마크(XMedBench)를 마련한다.
- 가벼운 모델(0.5B–7B)이 동급 규모의 동료들보다 우수한 성능을 보일 수 있으며, 프록시 튜닝을 통해 비공개 의료 데이터를 노출하지 않고도 더 큰 모델의 성능을 향상시킬 수 있음을 보여준다.
- 다국어 학습 및 데이터 재작성 전략이 다국어 의료 이해도를 개선할 수 있으며 잠재적 다국어 학습 위험을 분석한다.
제안 방법
- 의사.ma 데이터, 도서, 논문, 백과사전, 지침, 대화, 시험, 웹 소스에서 여섯 개 언어의 고품질 의료 데이터를 수집하여 ApolloCorpora를 생성한다.
- 사전 학습 데이터를 QA 쌍으로 재작성하여 사전 학습에서 지시 튜닝으로의 전환을 부드럽게 한다.
- 사전 학습 데이터와 지시 튜닝 데이터를 혼합하기 위해 적응형, 우선순위 기반 데이터 샘플링을 적용한다.
- 0.5B, 1.8B, 2B, 6B, 7B 매개변수의 Apollo 모델을 학습시키고 다국어 학습 및 언어별 학습 비교를 수행한다.
- 다국어 지식 평가를 위한 프롬프트를 사용해 XMedBench로 평가하고, 여러 언어에 걸친 실제 의학 시험 문제를 모방한다.
- ProxyTuning을 제안하고 평가하여 비공개 의료 데이터에 대한 직접적인 미세 조정 없이 더 큰 모델을 소형 미세 조정된 의료 모델과 일치시키도록 한다.
실험 결과
연구 질문
- RQ1의료 LLM의 다국어 학습이 언어별 모델이나 간단한 가중 평균보다 모든 언어에서 일관되게 더 우수한 성능을 보이는가?
- RQ2사전 학습 데이터를 QA 쌍으로 재작성하는 것이 다운스트림의 다국어 의료 성능에 어떤 영향을 미치는가?
- RQ3ProxyTuning이 비공개 의학 코퍼스를 중앙 집중식 학습에 노출시키지 않으면서 더 큰 일반 LLM으로 다국어 의료 능력을 확장할 수 있는가?
- RQ4다국어 의료 LLM에서 언어별 강점과 격차(예: 아랍어 및 힌디어)는 무엇이며, 혼합 학습이 이를 어떻게 완화할 수 있는가?
- RQ5혼합 학습 전략이 롱테일 언어 및 언어 간 지식 이전에 어떤 영향을 미치는가?
주요 결과
- 다국어 학습은 조사된 모든 언어에 대해 언어별 모델보다 평균적으로 성능 향상을 보인다.
- Apollo-7B는 동급 크기의 다국어 의료 LLM 중 최첨단 성능에 도달하며, Apollo-7B는 그 규모에서 GPT-3.5와 전체 성능이 맞먹는다.
- 아랍어와 힌디어는 다른 언어에 비해 성능이 약한 경향을 보이며 다국어 간 격차를 시사한다.
- 사전 학습 데이터를 QA 쌍으로 재작성하는 것만으로는 전체 성능에 해를 끼치지 않으며, 혼합 학습 이후의 매끄러운 전환이 비주류 언어에서 더 나은 결과를 낸다.
- 혼합 학습(다국어 데이터를 결합)은 단일 언어 학습 대비 다국어 의료 역량을 크게 향상시킨다.
- ProxyTuning은 더 큰 모델이 소형 Apollo 모델을 가이드로 사용해 다국어 의료 능력을 얻도록 하지만, 더 큰 모델을 비공개 의료 데이터로 미세 조정하지 않아도 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.