Skip to main content
QUICK REVIEW

[논문 리뷰] G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model

Jiahui Gao, Renjie Pi|arXiv (Cornell University)|2023. 12. 18.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 기하적 추론을 향상시키기 위해 LLM을 사용해 생성한 170K개의 기하학적 이미지-캡션 및 질문-답변 쌍으로 구성된 합성 데이터셋인 Geo170K에 맞춰 미세조정된 다중모달 대규모 언어 모델인 G-LLaVA를 제안한다. G-LLaVA는 오직 7B 파라미터로만 해도 GPT-4-V를 능가하는 최신 기술 수준의 성능을 기록하며, 기하학적 문제 해결을 위한 도메인 내 데이터 증강의 효과를 입증한다.

ABSTRACT

Large language models (LLMs) have shown remarkable proficiency in human-level reasoning and generation capabilities, which encourages extensive research on their application in mathematical problem solving. However, current work has been largely focused on text-based mathematical problems, with limited investigation in problems involving geometric information. Addressing this gap, we aim to enable LLMs to solve geometric problems by understanding image input. We first analyze the limitations of current Multimodal Large Language Models (MLLMs) in this area: they struggle to accurately comprehending basic geometric elements and their relationships. To overcome these challenges, we take advantage of the unique characteristics of geometric problems (such as unique geometric logical form, and geometric scalability) and the capacity of the textual LLMs to build an enriched multimodal geometry dataset based on existing data. The augmented dataset, Geo170K, contains more than 170K geometric image-caption and question-answer pairs. Utilizing our constructed Geo170K dataset, we develop G-LLaVA, which demonstrates exceptional performance in solving geometric problems, significantly outperforming GPT-4-V on the MathVista benchmark with only 7B parameters.

연구 동기 및 목표

  • 기존 다중모달 대규모 언어 모델(MLLM)이 기하학적 도형과 관계를 이해하는 데 한계가 있다는 문제를 해결하기 위해.
  • 다중모달 학습 분야에서 기하학적 추론 데이터셋의 부족성과 낮은 품질 문제를 해결하기 위해.
  • 텍스트 전용 LLM을 활용해 고품질이고 다양한 기하학적 시각-텍스트 데이터를 합성하는 방법을 개발하기 위해.
  • 도메인 내 사전학습과 지시 테이닝을 통해 기하학적 문제 해결에 뛰어난 성능을 내는 다중모달 모델을 훈련하기 위해.
  • 기하학적 논리와 확장성을 활용한 데이터 증강이 MLLM의 기하학적 추론 작업 성능을 크게 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 저자들은 기하학의 고유한 구조적 및 논리적 특성(예: 기하학적 확장성, 표현의 유일성, 논리적 형태 등)을 활용해 텍스트 전용 LLM을 사용해 기존 데이터셋에서 기하학적 이미지-캡션 및 질문-답변 쌍을 합성함으로써 Geo170K 데이터셋을 생성한다.
  • 모델은 두 단계로 훈련된다: 시각적 및 텍스트적 특징을 정렬하기 위한 프로젝션 헤드를 사용한 다중모달 정렬 단계, 이후 정제된 도메인 내 데이터를 사용한 지시 테이닝 단계.
  • 훈련 중에는 이미지를 정사각형 형식으로 리사이징하고 흰색 팯딩을 추가하며, 데이터 증강으로 이미지 콘텐츠의 최대 25% 이동을 적용한다.
  • 모델은 학습 가능한 프로젝션 레이어를 사용하며, 정렬 및 지시 테이닝 단계에서 시각 인코더와 언어 모델을 모두 미세조정한다.
  • 평가에는 정규표현식 기반의 답변 추출을 사용한 Top-1 정확도가 사용되며, 일관성을 확보하기 위해 모델이 고정된 형식으로 선택지를 출력하도록 프롬프트된다.
  • 다중모달 정렬 단계의 기여도를 검증하기 위해 명시적인 아블레이션 실험을 수행한다.

실험 결과

연구 질문

  • RQ1LLM을 활용한 합성 데이터 생성이 MLLM의 기하학적 추론 작업 성능을 크게 향상시킬 수 있는가?
  • RQ2정제된 대규모 기하학 데이터셋을 사용한 도메인 내 사전학습이 MLLM의 기하학적 도형과 관계 이해 능력을 향상시키는가?
  • RQ37B 파라미터의 MLLM이 GPT-4-V와 같은 더 크고 강력한 모델보다 기하학적 문제 해결에서 뛰어난 성능을 내는가?
  • RQ4다중모달 정렬이 모델이 각도, 선분, 도형과 같은 기하학적 요소를 해석하는 데 기여하는 방식은 무엇인가?
  • RQ5모델이 다양한 종류와 난이도의 기하학적 문제에 대해 얼마나 일반화되는가?

주요 결과

  • G-LLaVA-7B는 MathVista 벤치마크의 기하학 분할에서 GPT-4-V를 능가하며, Top-1 정확도 64.2%를 기록하여 더 작은 모델이 더 나은 도메인 내 데이터를 통해 더 큰 모델을 능가할 수 있음을 입증한다.
  • G-LLaVA-13B는 동일한 벤치마크에서 67.0%의 Top-1 정확도를 기록했으며, GPS 미닛테스트 분할에서 LLaVA-13B보다 27.4个百分点 높다.
  • 이해력이 높은 복잡도를 가진 문제들(문제 복잡도 OP >= 4)에 대해서도 G-LLaVA-7B는 40.9%의 정확도를 유지하며, LLaVA-7B의 22.9%보다 뚜렷이 높다.
  • 모델은 각도 관련 문제에서 70.7%의 정확도, 길이 문제에서 56.5%의 정확도를 기록했으며, 모든 기하학 문제 유형에서 기준 모델들을 능가한다.
  • 아블레이션 실험 결과, 다중모달 정렬 단계가 성능을 1.4个百分点 향상시켜(62.8%에서 64.2%로) 기하학적 이해 향상에 효과적임을 입증한다.
  • G-LLaVA의 Top-1 정확도는 기존 최고 성능 모델인 Geoformer(46.8%)와 UniMath(50.0%)의 Top-10 정확도를 초월하여 예측 정밀도가 뛰어나다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.