Skip to main content
QUICK REVIEW

[논문 리뷰] Can Open-Source LLMs Compete with Commercial Models? Exploring the Few-Shot Performance of Current GPT Models in Biomedical Tasks

Samy Ateia, Udo Kruschwitz|arXiv (Cornell University)|2024. 07. 18.
Scientific Computing and Data ManagementDecision Sciences인용 수 3
한 줄 요약

이 연구는 검색 증강 생성(RAG)을 사용하여 오픈소스 LLM이 의료 생물학 질문 응답에서 상용 모델과 경쟁할 수 있는지 평가한다. 10개의 예시를 사용한 희소 프롬프팅을 통해 Mixtral 8x7B는 제로샷 성능을 초월했으며, BioASQ 2024 도전대회에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 보였다. 이는 오픈소스 모델이 소수의 예시로 미세조정을 거쳐 도메인 특화 RAG 작업에서 경쟁 가능하다는 것을 보여준다.

ABSTRACT

Commercial large language models (LLMs), like OpenAI's GPT-4 powering ChatGPT and Anthropic's Claude 3 Opus, have dominated natural language processing (NLP) benchmarks across different domains. New competing Open-Source alternatives like Mixtral 8x7B or Llama 3 have emerged and seem to be closing the gap while often offering higher throughput and being less costly to use. Open-Source LLMs can also be self-hosted, which makes them interesting for enterprise and clinical use cases where sensitive data should not be processed by third parties. We participated in the 12th BioASQ challenge, which is a retrieval augmented generation (RAG) setting, and explored the performance of current GPT models Claude 3 Opus, GPT-3.5-turbo and Mixtral 8x7b with in-context learning (zero-shot, few-shot) and QLoRa fine-tuning. We also explored how additional relevant knowledge from Wikipedia added to the context-window of the LLM might improve their performance. Mixtral 8x7b was competitive in the 10-shot setting, both with and without fine-tuning, but failed to produce usable results in the zero-shot setting. QLoRa fine-tuning and Wikipedia context did not lead to measurable performance gains. Our results indicate that the performance gap between commercial and open-source models in RAG setups exists mainly in the zero-shot setting and can be closed by simply collecting few-shot examples for domain-specific use cases. The code needed to rerun these experiments is available through GitHub.

연구 동기 및 목표

  • 오픈소스 LLM이 도메인 특화 의료 생물학 질문 응답에서 상용 모델과 경쟁 가능한 성능을 달성할 수 있는지 평가하는 것.
  • 소수의 예시 학습이 검색 증강 생성(RAG) 환경에서 오픈소스 LLM에 미치는 영향을 조사하는 것.
  • QLoRA 미세조정과 위키백과 기반 컨텍스트 증강이 의료 생물학 질문 응답 작업의 성능 향상에 기여하는지 평가하는 것.
  • 데이터 기밀이 중요한 기업 및 임상 환경에서 오픈소스 모델의 구현 가능성을 탐색하는 것.
  • 소수의 예시 프롬프팅과 같은 실용적이고 저비용 방법을 통해 오픈소스 모델이 상용 모델과의 성능 격차를 줄일 수 있는지 판단하는 것.

제안 방법

  • 제로샷 및 소수의 예시 프롬프팅을 사용하여 BioASQ 2024 RAG 환경에서 Mixtral 8x7B, GPT-3.5-turbo, Claude 3 Opus 세 모델을 평가했다.
  • 의료 생물학 질문에 대한 지시 이행과 성능 향상을 위해 10개의 예시를 포함한 컨텍스트 학습을 적용했다.
  • 도메인 특화 의료 생물학 데이터를 기반으로 Mixtral 8x7B와 GPT-3.5-turbo에 QLoRA 미세조정을 적용했다.
  • 모델에게 추가 지식을 제공하기 위해 관련 위키백과 스니펫을 컨텍스트 윈도우에 통합했다.
  • PubMed 스니펫을 검색하고 간결하고 사실 기반의 답변을 생성하는 BioASQ Task B에서 성능을 평가했다.
  • 표준 의료 생물학 질문 응답 지표를 사용하여 답변 품질과 사실 일관성에 중점을 두고, 다양한 모델과 설정 간 성능을 비교했다.

실험 결과

연구 질문

  • RQ1Mixtral 8x7B와 같은 오픈소스 LLM이 의료 생물학 RAG 환경에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 낼 수 있는가?
  • RQ2제로샷 추론에 비해 소수의 예시 프롬프팅이 오픈소스 LLM의 의료 생물학 질문 응답 성능에 뚜렷한 향상을 가져오는가?
  • RQ3QLoRA 미세조정이 이 도메인 내 오픈소스 LLM의 답변 품질과 사실 일관성에 측정 가능한 향상을 가져오는가?
  • RQ4컨텍스트 윈도우에 위키백과 기반 지식을 추가하면 의료 생물학 질문 응답 작업에서 LLM의 성능이 향상되는가?
  • RQ5임상 또는 기업 응용 분야에서 오픈소스 모델와 상용 모델을 사용할 경우 비용, 기밀성, 성능 간의 상충 관계는 어떠한가?

주요 결과

  • Mixtral 8x7B는 10개의 예시 설정에서 GPT-4 및 Claude 3 Opus와 같은 상용 모델과 유사한 성능을 보였으며, 제로샷 성능을 뛰어넘었다.
  • Mixtral 8x7B의 제로샷 성능는 특히 구조화된 출력이 필요한 경우 실용적인 사용에 부적합했다.
  • 시험 환경에서 QLoRA 미세조정은 Mixtral 8x7B나 GPT-3.5-turbo 모두에 일관된 성능 향상을 가져오지 못했다.
  • 위키백과 지식을 컨텍스트에 통합하는 것은 답변 품질이나 검색 정확도에 측정 가능한 향상을 가져오지 못했다.
  • API를 통해 호스팅된 상용 모델은 유사한 오픈소스 인퍼런스 설정보다 최소 30배 이상 빠르고 저렴했다.
  • 소수의 예시 프롬프팅이 이 도메인 특화 RAG 작업에서 오픈소스 모델과 상용 모델 간 성능 격차를 줄이는 데 가장 효과적인 방법으로 부각되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.