Skip to main content
QUICK REVIEW

[논문 리뷰] SCITUNE: Aligning Large Language Models with Scientific Multimodal Instructions

Sameera Horawalavithana, Sai Munikoti|arXiv (Cornell University)|2023. 07. 03.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 과학적 다중모달 지시에 대응하기 위해 먼저 시각적 및 텍스트적 신호 간 과학적 개념을 정렬하고, 그 다음 과학적 추론 작업에서 피지컬 튜닝을 수행하는 이단계 프레임워크인 SciTune을 소개한다. 결과적으로 도출된 LLaMA-SciTune 모델은 ScienceQA 벤치마크에서 인간을 초월하고, 제로샷 과학 중심 시각 이해 작업에서 최신 기술(SOTA) 비전-언어 모델을 능가한다.

ABSTRACT

Instruction finetuning is a popular paradigm to align large language models (LLM) with human intent. Despite its popularity, this idea is less explored in improving the LLMs to align existing foundation models with scientific disciplines, concepts and goals. In this work, we present SciTune as a tuning framework to improve the ability of LLMs to follow scientific multimodal instructions. To test our methodology, we use a human-generated scientific instruction tuning dataset and train a large multimodal model LLaMA-SciTune that connects a vision encoder and LLM for science-focused visual and language understanding. In comparison to the models that are finetuned with machine generated data only, LLaMA-SciTune surpasses human performance on average and in many sub-categories on the ScienceQA benchmark.

연구 동기 및 목표

  • 지시 튜닝을 통해 대규모 언어 모델을 과학 분야, 개념, 목표와 정렬하는 데 있어 격차를 보완하기 위해.
  • 인간이 생성한 과학적 지시 데이터를 활용하여 과학적 맥락에서의 다중모달 추론을 향상시키기 위해.
  • 다중모달 환경에서 정밀한 과학적 절차와 지침을 따를 수 있는 능력을 향상시키기 위한 프레임워크를 개발하기 위해.
  • 과학 중심의 시각 및 언어 이해 작업에서 제로샷 일반화를 가능하게 하기 위해.
  • 대상 지시 튜닝을 통해 과학적 다중모달 추론 벤치마크에서 인간 성능을 초월하기 위해.

제안 방법

  • SciTune는 과학적 개념 정렬과 과학적 지시 튜닝의 두 단계로 구성된 훈련 프로세스를 사용한다.
  • 과학적 개념 정렬은 다양한 과학적 시각 신호(예: 그래프, 수식, 다이어그램)와 텍스트 신호(예: OCR, 캡션, 단락 언급)로부터 학습하는 것을 포함한다.
  • 과학적 지시 튜닝은 ScienceQA 벤치마크(21,000개의 다중모달 다중선택 문제 포함)를 포함한 다중모달 과학적 추론 데이터셋으로 모델을 피지컬 튜닝한다.
  • 프레임워크는 디코더 기반 LLM(LaMA)과 비전 인코더(CLIP)에 적용되어 LLaMA-SciTune 모델을 형성한다.
  • 분포 편향을 방지하고 사실 일관성을 향상시키기 위해 합성 데이터 대신 인간이 애너테이션한 과학적 지시 데이터를 사용한다.
  • 모델은 새로운 과학적 시각 이해 작업에 일반화할 수 있는지 평가하기 위해 제로샷 추론 설정에서 평가된다.
Figure 1: SciTune presents i) scientific concept alignment to learn across various scientific visual signals (e.g., plots, charts, equation, diagram, etc.), and textual signals (e.g., captions, OCR and paragraph mentions), ii) scientific instruction tuning to fine-tune on a multimodal scientific rea
Figure 1: SciTune presents i) scientific concept alignment to learn across various scientific visual signals (e.g., plots, charts, equation, diagram, etc.), and textual signals (e.g., captions, OCR and paragraph mentions), ii) scientific instruction tuning to fine-tune on a multimodal scientific rea

실험 결과

연구 질문

  • RQ1이중단계 지시 튜닝 프레임워크는 LLM의 과학적 다중모달 지시 따르기 능력을 향상시키는가?
  • RQ2인간이 생성한 과학적 지시 데이터로 훈련하면 합성 데이터로 훈련한 모델보다 성능이 뛰어나게 되는가?
  • RQ3과학 작업에 대해 피지컬 튜닝된 비전-언어 모델은 과학 추론 벤치마크에서 인간 성능을 초월할 수 있는가?
  • RQ4모델은 제로샷 과학 중심 시각 이해 작업으로 일반화되는가?
  • RQ5오류 발생 원인은 무엇이며, 언어적 특징과 시각적 특징은 잘못된 출력에 어떻게 기여하는가?

주요 결과

  • LLaMA-SciTune는 ScienceQA 다중모달 추론 벤치마크에서 인간 성능을 초월하며, 제로샷 추론에서 최신 기술(SOTA) 성능을 달성한다.
  • 모델은 예시 없이도 과학적 시각을 분류하고 정확한 그림 설명을 생성하는 데서도 기존 SOTA 비전-언어 모델을 능가한다.
  • 틀린 답변에 대해서는 정답보다 더 높은 ROUGE 점수(0.924)를 보이는 강의 구성 요소를 생성하여 강의 기억에 과도하게 적응한 것일 수 있음을 시사한다.
  • 정답일 경우 솔루션 생성에 대해 더 높은 BLEU와 ROUGE 점수를 보이며(예: 정답 솔루션의 ROUGE 0.937), 잘못된 답변일 경우에는 낮은 점수(ROUGE 0.778)를 기록한다.
  • 언어적 특징은 일반 지식 사실이나 비유적 언어에 대해 약한 반응을 보이며, 시각적 특징은 세는 것과 물체의 성질(예: 색상, 질감) 검색에 어려움을 겪는다.
  • 추론 오류는 주로 솔루션 단계에서 잘못된 추론 때문이며, 이는 훈련 및 추론 중에 더 나은 체인 오브 타ught 가이던스가 필요함을 시사한다.
(a) An example with right answer and right explanation
(a) An example with right answer and right explanation

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.