Skip to main content
QUICK REVIEW

[論文レビュー] Can Open-Source LLMs Compete with Commercial Models? Exploring the Few-Shot Performance of Current GPT Models in Biomedical Tasks

Samy Ateia, Udo Kruschwitz|arXiv (Cornell University)|Jul 18, 2024
Scientific Computing and Data ManagementDecision Sciences被引用数 3
ひとこと要約

本研究では、リtrieval-augmented generation (RAG) を用いて、オープンソース LLM が商業モデルと同等のバイオメディカルQA性能を達成できるかを評価している。10個の例を用いたfew-shotプロンプティングにより、Mixtral 8x7B はゼロショット設定を上回り、GPT-4 や Claude 3 Opus といった商業モデルと同等の性能を示した。これは、ファインチューニングを少数の例で行うことで、ドメイン特化型RAGタスクにおいてオープンソースモデルが競争力を持つ可能性を示している。

ABSTRACT

Commercial large language models (LLMs), like OpenAI's GPT-4 powering ChatGPT and Anthropic's Claude 3 Opus, have dominated natural language processing (NLP) benchmarks across different domains. New competing Open-Source alternatives like Mixtral 8x7B or Llama 3 have emerged and seem to be closing the gap while often offering higher throughput and being less costly to use. Open-Source LLMs can also be self-hosted, which makes them interesting for enterprise and clinical use cases where sensitive data should not be processed by third parties. We participated in the 12th BioASQ challenge, which is a retrieval augmented generation (RAG) setting, and explored the performance of current GPT models Claude 3 Opus, GPT-3.5-turbo and Mixtral 8x7b with in-context learning (zero-shot, few-shot) and QLoRa fine-tuning. We also explored how additional relevant knowledge from Wikipedia added to the context-window of the LLM might improve their performance. Mixtral 8x7b was competitive in the 10-shot setting, both with and without fine-tuning, but failed to produce usable results in the zero-shot setting. QLoRa fine-tuning and Wikipedia context did not lead to measurable performance gains. Our results indicate that the performance gap between commercial and open-source models in RAG setups exists mainly in the zero-shot setting and can be closed by simply collecting few-shot examples for domain-specific use cases. The code needed to rerun these experiments is available through GitHub.

研究の動機と目的

  • オープンソースLLMがドメイン特化型バイオメディカルQAにおいて商業モデルと同等の性能を達成できるかどうかを評価すること。
  • リトリーブ・アンバウンドジェネレーション(RAG)環境下におけるオープンソースLLMにおけるfew-shot学習の影響を調査すること。
  • QLoRAファインチューニングとWikipediaベースのコンテキスト拡張が、バイオメディカルQAタスクの性能に与える影響を評価すること。
  • データプライバシーが重要な企業および臨床現場でのオープンソースモデルの展開可能性を検討すること。
  • few-shotプロンプティングのような実用的で低コストな手法によって、オープンソースモデルが商業モデルとの性能格差を埋められるかどうかを特定すること。

提案手法

  • ゼロショットとfew-shotプロンプティングを用いて、BioASQ 2024のRAG設定で3つのLLM(Mixtral 8x7B、GPT-3.5-turbo、Claude 3 Opus)を評価した。
  • バイオメディカル質問の処理向上のため、10ショットの例を用いたコンテキスト学習を適用した。
  • ドメイン特化型バイオメディカルデータを用いて、Mixtral 8x7B と GPT-3.5-turbo のQ-LoRAファインチューニングを実施した。
  • モデルに追加の知識を提供するために、関連するWikipediaスニペットをコンテキストウィンドウに追加した。
  • PubMedスニペットの検索と、要約的かつ事実基盤に立脚した回答生成を要するBioASQタスクBで性能を評価した。
  • 標準的なバイオメディカルQAメトリクスを用いて、回答品質と事実整合性に注目して、モデル間および設定間の結果を比較した。

実験結果

リサーチクエスチョン

  • RQ1オープンソースLLM(例:Mixtral 8x7B)は、バイオメディカルRAG環境下でGPT-4 や Claude 3 Opus といった商業モデルと同等の性能を達成できるか?
  • RQ2ゼロショット推論と比較して、few-shotプロンプティングはオープンソースLLMのバイオメディカルQA性能を顕著に向上させるか?
  • RQ3QLoRAファインチューニングは、このドメインにおけるオープンソースLLMの回答品質と事実整合性に測定可能な改善をもたらすか?
  • RQ4コンテキストウィンドウにWikipedia由来の知識を追加することで、LLMのバイオメディカルQAタスク性能が向上するか?
  • RQ5臨床的・企業的応用において、オープンソースLLMと商業LLMを比較した場合、コスト、プライバシー、パフォーマンスのトレードオフはどのようなものか?

主な発見

  • 10ショット設定において、Mixtral 8x7B はGPT-4 や Claude 3 Opus といった商業モデルと同等の性能を示し、ゼロショット設定を上回った。
  • Mixtral 8x7B のゼロショット性能は、特に構造化出力が求められる状況では実用的ではなかった。
  • テストされた設定において、QLoRAファインチューニングは Mixtral 8x7B や GPT-3.5-turbo に対して一貫した性能向上をもたらさなかった。
  • Wikipediaの知識をコンテキストに追加しても、回答品質やリtrieval精度に顕著な向上は見られなかった。
  • API経由でホスティングされた商業モデルは、同等のオープンソース推論環境よりも著しく高速であり、少なくとも30倍安価であった。
  • few-shotプロンプティングが、このドメイン特化型RAGタスクにおいて、オープンソースモデルと商業モデルの性能格差を埋める最も効果的な手法であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。