[논문 리뷰] Can Open-Source LLMs Compete with Commercial Models? Exploring the Few-Shot Performance of Current GPT Models in Biomedical Tasks
이 연구는 검색 증강 생성(RAG)을 사용하여 오픈소스 LLM이 의료 생물학 질문 응답에서 상용 모델과 경쟁할 수 있는지 평가한다. 10개의 예시를 사용한 희소 프롬프팅을 통해 Mixtral 8x7B는 제로샷 성능을 초월했으며, BioASQ 2024 도전대회에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 보였다. 이는 오픈소스 모델이 소수의 예시로 미세조정을 거쳐 도메인 특화 RAG 작업에서 경쟁 가능하다는 것을 보여준다.
Commercial large language models (LLMs), like OpenAI's GPT-4 powering ChatGPT and Anthropic's Claude 3 Opus, have dominated natural language processing (NLP) benchmarks across different domains. New competing Open-Source alternatives like Mixtral 8x7B or Llama 3 have emerged and seem to be closing the gap while often offering higher throughput and being less costly to use. Open-Source LLMs can also be self-hosted, which makes them interesting for enterprise and clinical use cases where sensitive data should not be processed by third parties. We participated in the 12th BioASQ challenge, which is a retrieval augmented generation (RAG) setting, and explored the performance of current GPT models Claude 3 Opus, GPT-3.5-turbo and Mixtral 8x7b with in-context learning (zero-shot, few-shot) and QLoRa fine-tuning. We also explored how additional relevant knowledge from Wikipedia added to the context-window of the LLM might improve their performance. Mixtral 8x7b was competitive in the 10-shot setting, both with and without fine-tuning, but failed to produce usable results in the zero-shot setting. QLoRa fine-tuning and Wikipedia context did not lead to measurable performance gains. Our results indicate that the performance gap between commercial and open-source models in RAG setups exists mainly in the zero-shot setting and can be closed by simply collecting few-shot examples for domain-specific use cases. The code needed to rerun these experiments is available through GitHub.
연구 동기 및 목표
- 오픈소스 LLM이 도메인 특화 의료 생물학 질문 응답에서 상용 모델과 경쟁 가능한 성능을 달성할 수 있는지 평가하는 것.
- 소수의 예시 학습이 검색 증강 생성(RAG) 환경에서 오픈소스 LLM에 미치는 영향을 조사하는 것.
- QLoRA 미세조정과 위키백과 기반 컨텍스트 증강이 의료 생물학 질문 응답 작업의 성능 향상에 기여하는지 평가하는 것.
- 데이터 기밀이 중요한 기업 및 임상 환경에서 오픈소스 모델의 구현 가능성을 탐색하는 것.
- 소수의 예시 프롬프팅과 같은 실용적이고 저비용 방법을 통해 오픈소스 모델이 상용 모델과의 성능 격차를 줄일 수 있는지 판단하는 것.
제안 방법
- 제로샷 및 소수의 예시 프롬프팅을 사용하여 BioASQ 2024 RAG 환경에서 Mixtral 8x7B, GPT-3.5-turbo, Claude 3 Opus 세 모델을 평가했다.
- 의료 생물학 질문에 대한 지시 이행과 성능 향상을 위해 10개의 예시를 포함한 컨텍스트 학습을 적용했다.
- 도메인 특화 의료 생물학 데이터를 기반으로 Mixtral 8x7B와 GPT-3.5-turbo에 QLoRA 미세조정을 적용했다.
- 모델에게 추가 지식을 제공하기 위해 관련 위키백과 스니펫을 컨텍스트 윈도우에 통합했다.
- PubMed 스니펫을 검색하고 간결하고 사실 기반의 답변을 생성하는 BioASQ Task B에서 성능을 평가했다.
- 표준 의료 생물학 질문 응답 지표를 사용하여 답변 품질과 사실 일관성에 중점을 두고, 다양한 모델과 설정 간 성능을 비교했다.
실험 결과
연구 질문
- RQ1Mixtral 8x7B와 같은 오픈소스 LLM이 의료 생물학 RAG 환경에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 낼 수 있는가?
- RQ2제로샷 추론에 비해 소수의 예시 프롬프팅이 오픈소스 LLM의 의료 생물학 질문 응답 성능에 뚜렷한 향상을 가져오는가?
- RQ3QLoRA 미세조정이 이 도메인 내 오픈소스 LLM의 답변 품질과 사실 일관성에 측정 가능한 향상을 가져오는가?
- RQ4컨텍스트 윈도우에 위키백과 기반 지식을 추가하면 의료 생물학 질문 응답 작업에서 LLM의 성능이 향상되는가?
- RQ5임상 또는 기업 응용 분야에서 오픈소스 모델와 상용 모델을 사용할 경우 비용, 기밀성, 성능 간의 상충 관계는 어떠한가?
주요 결과
- Mixtral 8x7B는 10개의 예시 설정에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 보였으며, 제로샷 성능을 뛰어넘었다.
- Mixtral 8x7B의 제로샷 성능는 특히 구조화된 출력이 필요한 경우 실용적인 사용에 부적합했다.
- 시험 환경에서 QLoRA 미세조정은 Mixtral 8x7B나 GPT-3.5-turbo 모두에 일관된 성능 향상을 가져오지 못했다.
- 위키백과 지식을 컨텍스트에 통합하는 것은 답변 품질이나 검색 정확도에 측정 가능한 향상을 가져오지 못했다.
- API를 통해 호스팅된 상용 모델은 유사한 오픈소스 인퍼런스 설정보다 최소 30배 이상 빠르고 저렴했다.
- 소수의 예시 프롬프팅이 이 도메인 특화 RAG 작업에서 오픈소스 모델과 상용 모델 간 성능 격차를 줄이는 데 가장 효과적인 방법으로 부각되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.