Skip to main content
QUICK REVIEW

[論文レビュー] SPARQL Generation: an analysis on fine-tuning OpenLLaMA for Question Answering over a Life Science Knowledge Graph

Julio C. Rangel, Tarcisio Mendes de Farias|arXiv (Cornell University)|Feb 7, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用数 3
ひとこと要約

本論文は、意味的ヒント(意味のある変数名やインラインコメントなど)を用いて、生命科学知識グラフ上のSPARQLクエリ生成のためのOpenLLaMAのファインチューニングを可能にするデータ拡張フレームワークを提案する。この手法により、ランダムな変数名やコメントなしの設定と比較して、モデル性能が最大33%向上する。特に、オープンドメインデータセットからの知識移行ではなく、ドメイン固有の拡張データに対して直接ファインチューニングを行うことで、最良の結果が得られる。

ABSTRACT

The recent success of Large Language Models (LLM) in a wide range of Natural Language Processing applications opens the path towards novel Question Answering Systems over Knowledge Graphs leveraging LLMs. However, one of the main obstacles preventing their implementation is the scarcity of training data for the task of translating questions into corresponding SPARQL queries, particularly in the case of domain-specific KGs. To overcome this challenge, in this study, we evaluate several strategies for fine-tuning the OpenLlama LLM for question answering over life science knowledge graphs. In particular, we propose an end-to-end data augmentation approach for extending a set of existing queries over a given knowledge graph towards a larger dataset of semantically enriched question-to-SPARQL query pairs, enabling fine-tuning even for datasets where these pairs are scarce. In this context, we also investigate the role of semantic "clues" in the queries, such as meaningful variable names and inline comments. Finally, we evaluate our approach over the real-world Bgee gene expression knowledge graph and we show that semantic clues can improve model performance by up to 33% compared to a baseline with random variable names and no comments included.

研究の動機と目的

  • 生命科学知識グラフにおける質問-SPARQLクエリペアの不足が、質問応答のためのLLMの有効なファインチューニングを妨げているという問題に対処すること。
  • 初期データセットが小さい状態から、意味的に豊かで拡張された質問-SPARQLペアを生成するエンドツーエンドのデータ拡張戦略を開発すること。
  • 意味的ヒント(意味のある変数名やインラインコメントなど)がSPARQLクエリ生成性能に与える影響を評価すること。
  • オープンドメインデータセット(例:KQA_Pro)からの知識移行が、Bgeeなどのドメイン固有の生命科学KBでの性能向上に寄与するかを調査すること。
  • Bgee遺伝子発現知識グラフを対象とした科学的質問応答のための、高品質でオープンアクセス可能な2,500組以上の質問-SPARQLペアのデータセットを構築すること。

提案手法

  • エンドツーエンドのデータ拡張パイプラインにより、既存のクエリを再表現し、SPARQL構文を変更しながら意味を保持する新しい質問-SPARQLペアを生成する。
  • ランダムな変数名を意味のあるもの(例:'var1' の代わりに 'gene')に置き換え、プロパティラベルを説明するインラインコメントを追加することで、意味的ヒントを導入する。
  • 15個の初期Bgeeクエリから、5種類の異なる拡張データセットを生成し、それぞれが513件のクエリを含む。合計で2,500組を超えるペアが得られた。
  • OpenLLaMA_7b_v2モデルをこれらの拡張データセット上でファインチューニングし、意味的ヒントの有無を比較するアブレーションスタディを実施する。
  • 知識移行の評価は、まずWikidataを対象としたKQA_ProデータセットでOpenLLaMAをファインチューニングした後、Bgeeデータセットでさらにファインチューニングすることで行う。
  • 性能評価には、複数の設定で標準的なNLP指標(BLEU、SP-BLEU、METEOR、ROUGE-L)を用いる。
Figure 1: System Architecture. We augment an existing catalog of representative questions over a given knowledge graph and fine-tune OpenLlama in two steps: We first fine-tune the base model using the KQA Pro dataset over Wikidata. Next, we further fine-tune the resulting model using the extended se
Figure 1: System Architecture. We augment an existing catalog of representative questions over a given knowledge graph and fine-tune OpenLlama in two steps: We first fine-tune the base model using the KQA Pro dataset over Wikidata. Next, we further fine-tune the resulting model using the extended se

実験結果

リサーチクエスチョン

  • RQ1データ拡張は、生命科学知識グラフにおける意味的に正しいSPARQLクエリの生成性能を顕著に向上させることができるか?
  • RQ2意味的ヒント(意味のある変数名やインラインコメントなど)は、SPARQLクエリ生成の正確性をどの程度向上させるか?
  • RQ3一般ドメインのデータセット(例:KQA_Pro)からの知識移行は、Bgeeのようなドメイン固有の生命科学KBでのファインチューニング性能を向上させるか?
  • RQ4拡張されたトレーニングデータセットのサイズは、モデルが正しいSPARQLクエリを生成する能力にどのように影響するか?
  • RQ5オープンドメイン事前学習を経てのマルチステージファインチューニングよりも、ドメイン固有のデータに対して直接ファインチューニングする方が効果的か?

主な発見

  • 意味的ヒント(意味のある変数名とインラインコメント)の導入により、ランダムな変数名とコメントなしの設定と比較して、ROUGE-Lスコアが最大33%向上した。
  • KQA_Proで事前学習した後、Bgeeでファインチューニングするマルチステージアプローチは、直接Bgeeの拡張データセットでファインチューニングする手法に比べて性能が劣り、改善が見られないか、むしろ性能低下を示した。
  • 最も優れた性能を示したモデルは、'Bgee meaningful vars comments'データセットでファインチューニングされたもので、ベースライン(ランダム変数名、コメントなし)と比較して、BLEU、SP-BLEU、METEORスコアで80%以上の向上を達成した。
  • トレーニングデータサイズが増加するにつれて性能が一貫して向上し、拡張された'意味のある変数名とコメント'データセットの25%から100%まで段階的な向上が観察された。
  • 最終的なデータセットは2,500組を超える意味的に豊かで拡張された質問-SPARQLペアを含み、科学的KGQA研究の貴重なリソースとなった。
  • 本研究は、SPARQLクエリの意味的強化が、ドメイン固有の知識グラフクエリにおいてLLMの一般化性能を高める、非常に効果的で低コストな戦略であることを示した。
Figure 2: Enhancement in the SPARQL query generation performance (y-axis) with partitions in increments of 25% of the “Bgee meaningful vars comments" training set (x-axis).
Figure 2: Enhancement in the SPARQL query generation performance (y-axis) with partitions in increments of 25% of the “Bgee meaningful vars comments" training set (x-axis).

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。