Skip to main content
QUICK REVIEW

[논문 리뷰] MM-PhyRLHF: Reinforcement Learning Framework for Multimodal Physics Question-Answering

Janak Kapuriya, Chhavi Kirtani|arXiv (Cornell University)|2024. 04. 19.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 LLaVA 기반 모델에서 다중모달 물리 문제 해결 능력을 향상시키기 위해 이미지 설명과 인간 피드백을 통한 강화학습(RLHF)을 통합한 강화학습 프레임워크인 MM-PhyRLHF를 제안한다. 자세한 이미지 설명을 통해 시각적 이해를 향상시키고, 인간 선호도 기반 보상 모델링을 통해 추론를 정교화함으로써, MM-PhyQA 데이터셋에서 정확도를 83.28%로 끌어올렸다. 이는 단순 지도 학습 미세조정보다 뚜렷하게 뛰어난 성능을 보였다.

ABSTRACT

Recent advancements in LLMs have shown their significant potential in tasks like text summarization and generation. Yet, they often encounter difficulty while solving complex physics problems that require arithmetic calculation and a good understanding of concepts. Moreover, many physics problems include images that contain important details required to understand the problem's context. We propose an LMM-based chatbot to answer multimodal physics MCQs. For domain adaptation, we utilize the MM-PhyQA dataset comprising Indian high school-level multimodal physics problems. To improve the LMM's performance, we experiment with two techniques, RLHF (Reinforcement Learning from Human Feedback) and Image Captioning. In image captioning, we add a detailed explanation of the diagram in each image, minimizing hallucinations and image processing errors. We further explore the integration of Reinforcement Learning from Human Feedback (RLHF) methodology inspired by the ranking approach in RLHF to enhance the human-like problem-solving abilities of the models. The RLHF approach incorporates human feedback into the learning process of LLMs, improving the model's problem-solving skills, truthfulness, and reasoning capabilities, minimizing the hallucinations in the answers, and improving the quality instead of using vanilla-supervised fine-tuned models. We employ the LLaVA open-source model to answer multimodal physics MCQs and compare the performance with and without using RLHF.

연구 동기 및 목표

  • 복잡한 산술 추론과 시각적 이해가 필요한 다중모달 물리 문제 해결에서 LLM의 한계를 해결하기 위해.
  • 이미지에 자세한 설명을 추가하여 다중모달 물리 문제 해결에서 환각 현상과 사실 일관성을 개선하기 위해.
  • 인간 선호도 기반 강화학습(RLHF)을 통해 추론 능력과 응답 품질을 향상시키고, 모델 출력을 인간의 선호도에 맞추기 위해.
  • 이미지 설명과 RLHF의 조합이 인도 고등학교 수준의 물리 다중선택 문제에서 성능에 미치는 영향을 평가하기 위해.
  • 다중모달 LLM을 활용해 물리 교육에 특화된 강력하고 오픈소스 기반의 교육 AI 시스템을 개발하기 위해.

제안 방법

  • 자세한 이미지 설명을 포함한 수정된 MM-PhyQA 데이터셋을 사용해 LLaVA-1.5 모델을 미세조정하였다. 이 이미지 설명은 Infi-MM 설명 모델을 통해 생성되었다.
  • 세 가지 입력 조합(텍스트 + 이미지, 텍스트 + 설명, 텍스트 + 이미지 + 설명)을 사용해 지도 미세조정(SFT)을 적용하였다.
  • 인간 평가자들이 응답 품질을 순위 매긴 데이터셋을 기반으로 인간 선호도 기반 보상 모델링을 통한 RLHF를 통합하였다. 주로 추론의 일관성과 프롬프트 준수 정도를 중심으로 평가하였다.
  • 인간 선호도 순위를 기반으로 응답 품질을 예측하는 보상 모델(RM)을 훈련시켰으며, 이는 이후 Proximal Policy Optimization(PPO)를 통해 정책 최적화를 이끄는 데 사용되었다.
  • 효율적인 미세조정을 위해 LoRA(Low-Rank Adaptation)를 활용하였으며, 다양한 LoRA 랭크와 모델 크기(7B, 13B)를 테스트하여 속도와 성능의 균형을 맞추었다.
  • 다중 이미지 체인 오브 써포트(Chain-of-Thought) 프롬프팅을 RLHF와 이미지 설명과 조합하여 물리 문제 해결에서의 단계별 추론 능력을 향상시켰다.
Figure 1. Preference dataset Pipeline
Figure 1. Preference dataset Pipeline

실험 결과

연구 질문

  • RQ1다중모달 물리 데이터셋에 자세한 이미지 설명을 추가하면 LLM의 추론 능력과 정확도에 어떤 영향을 미치는가?
  • RQ2RLHF 통합이 물리 QA에서 LLM의 생성 응답에 대한 사실 일관성, 추론 품질, 진실성에 얼마나 기여하는가?
  • RQ3이미지 설명과 RLHF 중 어느 요소가 다중모달 물리 문제 해결 정확도 향상에 더 큰 기여를 하는가?
  • RQ4다양한 LLaVA 모델 크기와 LoRA 설정이 제안된 프레임워크의 효과성에 어떤 영향을 미치는가?
  • RQ5표준 지도 미세조정 대비 RLHF와 이미지 설명의 통합이 다중모달 물리 문제 해결에서 환각 현상을 줄이는가?

주요 결과

  • LLaVA-1.5 13b 모델을 사용해 텍스트, 이미지, 설명 입력을 모두 활용하고 RLHF를 적용한 경우 정확도가 83.28%로 가장 높았으며, 이는 기준 SFT 전용 접근 방식보다 뚜렷하게 뛰어난 성능을 보였다.
  • 이미지 입력 없이 이미지 설명만 사용한 SFT는 13b LoRA 대규모 모델에서 74.56%의 정확도를 기록했으며, 이는 시각적 데이터가 누락된 상황에서도 텍스트 기반 시각적 묘사가 효과적으로 보완된다는 것을 시사한다.
  • 훈련 데이터에 이미지 설명을 추가함으로써 SFT 정확도가 텍스트 + 이미지만 사용한 경우의 53.3%에서 텍스트 + 이미지 + 설명 조합의 82.52%로 상승하여 29.22%포인트 향상됨을 확인했다.
  • RLHF 통합으로 성능이 추가로 향상되었으며, 최고 성능을 낸 설정(텍스트 + 이미지 + 설명 + RLHF)에서 83.28%의 정확도를 달성하여 인간 피드백 기반 정밀 조정이 추론 능력과 사실 정확도 향상에 기여함을 입증했다.
  • LoRA 대규모 설정(Rank 128)을 사용한 13b 모델이 더 작은 LoRA 설정보다 뛰어난 성능을 보였으며, 이는 복잡한 추론 과제에서 높은 매개변수 효율성의 적응 방식이 성능 향상에 기여함을 시사한다.
  • 이미지 설명과 RLHF의 조합은 환각 현상을 줄이고 응답의 일관성을 향상시켰으며, 인간 선호도 기반 보상 모델링을 통해 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.