[논문 리뷰] Towards Ontology-Enhanced Representation Learning for Large Language Models
이 논문은 GPT-3.5-turbo를 활용한 합성 정의 생성과 대조적 미세튜닝을 통해 생물의학 온톨로지, 특히 MONDO에서 지식을 융합하여 임bedding 기반 대규모 언어모델(Large Language Models, LLMs)의 성능을 향상시키는 새로운 방법을 제안한다. 이 방법은 도메인 내 문장 유사도 성능을 향상시키지만 도메인 외 일반화 능력을 떨어뜨리지 않으며, 특히 기본 방법으로 사전학습된 모델에 대해 일관된 성능 향상을 보여준다.
Taking advantage of the widespread use of ontologies to organise and harmonize knowledge across several distinct domains, this paper proposes a novel approach to improve an embedding-Large Language Model (embedding-LLM) of interest by infusing the knowledge formalized by a reference ontology: ontological knowledge infusion aims at boosting the ability of the considered LLM to effectively model the knowledge domain described by the infused ontology. The linguistic information (i.e. concept synonyms and descriptions) and structural information (i.e. is-a relations) formalized by the ontology are utilized to compile a comprehensive set of concept definitions, with the assistance of a powerful generative LLM (i.e. GPT-3.5-turbo). These concept definitions are then employed to fine-tune the target embedding-LLM using a contrastive learning framework. To demonstrate and evaluate the proposed approach, we utilize the biomedical disease ontology MONDO. The results show that embedding-LLMs enhanced by ontological disease knowledge exhibit an improved capability to effectively evaluate the similarity of in-domain sentences from biomedical documents mentioning diseases, without compromising their out-of-domain performance.
연구 동기 및 목표
- 외부 온톨로지로부터 구조적 지식과 언어적 지식을 통합하여 임bedding 기반 LLM의 표현 학습을 향상시키기 위해.
- 생물의학과 같은 전문 분야에서 정밀한 의미 관계를 포착하지 못하는 도메인 특화 LLM의 한계를 해결하기 위해.
- 온톨로지의 구조와 생성형 LLM을 활용하여 자동화되고 확장 가능한 지식 융합 방법을 개발하기 위해.
- 지식 융합된 LLM의 도메인 내 및 도메인 외 문장 유사도 작업에서의 효과성을 평가하기 위해.
- 모델의 일반화 능력을 훼손하지 않으면서 성능 향상을 보장하기 위해.
제안 방법
- 온톨로지의 구조적 정보(예: is-a 관계)와 언어적 정보(예: 동의어, 기술)를 활용하여 GPT-3.5-turbo를 통해 모든 온톨로지 개념에 대한 합성적이고 종합적인 정의를 생성한다.
- 온톨로지적 관계와 의미 유사도를 기반으로 의미적으로 유사하거나 비유사한 정의 쌍을 구성하여 대조적 학습을 위한 학습 샘플을 제작한다.
- 양성 쌍의 임베딩 유사도를 최대화하고 음성 쌍의 유사도를 최소화하는 대조적 학습 목표를 사용하여 대상 임bedding-LLM을 미세튜닝한다.
- 미세튜닝 중 LLM이 양성 및 음성 정의 쌍을 모두 인코딩하는 듀얼 인코더 프레임워크를 활용한다.
- 질병 관련 문장 유사도 평가를 위해 MONDO, 생물의학 질병 온톨로지에 지식 융합 파이프라인을 적용한다.
- GitHub 레포지토리에 프레임워크, 프롬프트, 하이퍼파라미터, 평가 절차를 공개하여 재현 가능성을 확보한다.

실험 결과
연구 질문
- RQ1구조화된 온톨로지인 MONDO에서 지식을 융합하면 생물의학 분야의 임bedding-LLM의 문장 유사도 성능이 향상될 수 있는가?
- RQ2지식 융합 후 제안된 방법이 LLM의 도메인 외 일반화 능력을 유지하거나 향상시키는가?
- RQ3다양한 사전학습 전략을 가진 다양한 LLM 아키텍처에서 성능 향상은 어떻게 달라지는가?
- RQ4온톨로지의 구조에서 유도된 전체 문장 정의를 사용할 경우, 명사구나 동의어 기반 방법에 비해 얼마나 더 우수한 성능을 내는가?
- RQ5생성형 LLM이 대조적 미세튜닝을 향상시키는 고품질이고 다양한 정의를 효과적으로 합성할 수 있는가?
주요 결과
- MONDO에서 온톨로지 지식을 융합한 임bedding-LLM은 특히 기본 사전학습 방식을 사용한 PubMedBERT와 같은 모델에서 도메인 내 문장 유사도 작업에서 성능 향상을 보였다.
- 이 방법은 도메인 외 성능을 유지하거나 약간 향상시키며, 일반화 능력 저하가 없음을 시사한다.
- 더 고급 모델인 GTEbase와 GIST는 대부분의 평가 시나리오에서 더 작은 성능 향상이지만 일관된 개선을 보였다.
- 최첨단 생물의학 LLM인 SapBERT는 지식 융합 후 추가적인 성능 향상을 달성하여, 이 방법이 강력한 기준 모델에도 효과적임을 확인했다.
- 이 방법은 확장성과 재현 가능성을 입증하였으며, 전체 구현 및 평가 코드가 GitHub에 공개되어 있다.
- 온톨로지의 구조에서 파생된 전체 문장 정의의 사용은 동의어 기반 방법에 비해 더 견고하고 의미적으로 풍부한 표현을 생성함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.