[논문 리뷰] SciCode: A Research Coding Benchmark Curated by Scientists
SciCode는 물리학, 화학, 생물학, 재료 과학 등 다양한 자연과학 분야에서 과학자들이 기여한 80개의 복잡한 과학적 프로그래밍 문제를 포함한 엄격한 벤치마크로, 지식 재현, 추론, 코드 합성 요구가 필요한 338개의 하位 문제로 분해되었다. 가장 현실적인 평가 환경에서조차도 최고의 모델인 Claude3.5-Sonnet조차도 주 문제의 4.6%만 해결할 수 있었으며, 이는 벤치마크의 엄격성과 현재 대규모 언어 모델이 과학적 코드 생성에서 겪는 한계를 잘 보여준다.
Since language models (LMs) now outperform average humans on many challenging tasks, it has become increasingly difficult to develop challenging, high-quality, and realistic evaluations. We address this issue by examining LMs' capabilities to generate code for solving real scientific research problems. Incorporating input from scientists and AI researchers in 16 diverse natural science sub-fields, including mathematics, physics, chemistry, biology, and materials science, we created a scientist-curated coding benchmark, SciCode. The problems in SciCode naturally factorize into multiple subproblems, each involving knowledge recall, reasoning, and code synthesis. In total, SciCode contains 338 subproblems decomposed from 80 challenging main problems. It offers optional descriptions specifying useful scientific background information and scientist-annotated gold-standard solutions and test cases for evaluation. Claude3.5-Sonnet, the best-performing model among those tested, can solve only 4.6% of the problems in the most realistic setting. We believe that SciCode demonstrates both contemporary LMs' progress towards becoming helpful scientific assistants and sheds light on the development and evaluation of scientific AI in the future.
연구 동기 및 목표
- 기존 언어 모델 벤치마크의 포화를 해결하기 위해 과학적 코드 생성을 위한 고품질이고 현실적인 평가 세트를 구축하기 위해.
- 실제 과학 연구 과제를 반영하여 천연 과학 분야의 실용적 응용에 관련성을 갖춘 벤치마크를 개발하기 위해.
- 기존 공개 데이터셋과의 중복을 방지하고 연구 자료에서 문제를 기여함으로써 데이터 오염과 모델 오버피팅 문제를 해결하기 위해.
- 지식 재현, 추론, 통합 능력 등 다양한 능력을 복합적이고 다단계적인 과학 문제에서 평가하기 위해.
- 완전한 애너테이션과 테스트 케이스를 제공하는 도전적이고 체계적인 벤치마크를 통해 과학적 발견을 가속화하는 데 새로운 AI 연구를 이끌기 위해.
제안 방법
- 물리학, 화학, 생물학, 재료 과학 등 16개의 천연 과학 하위 분야에서 도메인 전문가들과 협력하여 80개의 주 과학 문제를 기여함.
- 각 주 문제를 개별 함수 구현이 필요한 다수의 하위 문제로 분해하여 모듈러한 평가와 단계적 추론를 가능하게 함.
- 각 하위 문제에 대해 과학적 배경 정보, 골드 표준 솔루션, 다수의 테스트 케이스를 제공하였으며, 각 도메인에서 최소 두 명의 고위 연구원이 애너테이션 및 검증을 수행함.
- 배경 정보 제공 여부 및 이전 하위 문제 출력에 대한 조건부 설정을 토글할 수 있는 평가 설정을 설계하여 다양한 현실 수준에서 모델의 강건성 평가를 가능하게 함.
- 기존 공개 벤치마크와의 중복을 제거하고 과학적 정확성을 유지하기 위해 필요할 경우에만 복잡한 문제를 단순화함으로써 데이터셋의 무결성을 확보함.
- 재현 가능성을 높이고 커뮤니티 참여를 지원하기 위해 https://scicode-bench.github.io/ 에서 랭킹 보드와 오픈소스 코드베이스를 구현함.

실험 결과
연구 질문
- RQ1최첨단 언어 모델은 실제 연구에서 유래한 다단계 과학적 문제에 대해 정확하고 통합된 과학적 코드를 얼마나 잘 생성할 수 있는가?
- RQ2과학적 배경 지식의 포함 여부가 도메인 특화 프로그래밍 과제 해결 능력에 어떤 영향을 미치는가?
- RQ3특허 모델과 오픈소스 모델은 과학적으로 기반을 두고 추론 중심인 코드 생성 과제에서 어떻게 비교되는가?
- RQ4모델 아키텍처와 훈련 데이터가 프리트레인 중에 볼 수 없었던 새로운 과학 문제로 일반화하는 능력에 어떤 영향을 미치는가?
- RQ5높은 과학적 정확도와 최소한의 데이터 泄露를 갖춘 벤치마크는 과학적 발견 가속화에서 AI의 역할을 평가하는 신뢰할 수 있는 대체 측정 기준이 될 수 있는가?
주요 결과
- 가장 뛰어난 성능을 보인 모델인 Claude3.5-Sonnet조차도 가장 현실적인 평가 환경에서 주 문제의 4.6%만 해결하여 향후 개선 여지가 크다는 점을 시사함.
- Claude3-Opus와 GPT-4o는 각각 주 문제의 1.5%만 해결하여, 심지어 최고 수준의 특허 모델조차도 복잡한 과학적 코드 합성에서 어려움을 겪고 있음을 보여줌.
- 가장 뛰어난 오픈소스 모델인 Deepseek-Coder-v2도 문제의 3.1%만 해결하여, 과학적 프로그래밍 과제에서 닫힌 모델과 오픈소스 모델 간의 성능 격차가 뚜렷하다는 점을 입증함.
- 기타 오픈소스 모델들, Llama-3-70B-Instruct 및 Mixtral-8x7b는 1% 미만의 문제를 해결하여, 현재 오픈소스 모델들이 과학적 추론 및 코드 생성 능력에서 여전히 한계를 지닌다는 점을 강조함.
- 과학적 배경 정보와 테스트 케이스를 포함한 벤치마크의 설계가 평가의 신뢰성 향상에 기여하며, 모델 실패 원인에 대한 세분화된 분석을 가능하게 함.
- 실제 연구에서 유래하고 깊은 도메인 지식이 요구되는 문제의 난이도가 높다는 점을 고려할 때, SciCode가 과학적 AI 평가를 위한 도전적이고 현실적인 벤치마크임을 확인함.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.