Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Text-Embedding-informed Cognitive Diagnosis of Large Language Models

Jia Liu, Zhiyu Xu|arXiv (Cornell University)|2026. 03. 16.
Psychometric Methodologies and Testing인용 수 0
한 줄 요약

논문은 임베딩 기반 사전 정보를 학습하여 Q-매트릭스를 학습하고 SAEM을 사용해 잠재 속성 및 항목 파라미터를 공동 추정함으로써 대형 벤치마크에 대한 미세한 규모의 진단을 가능하게 하는 확장 가능한 인지 진단 프레임워크를 개발한다.

ABSTRACT

Large language models (LLMs) have achieved remarkable performance on diverse benchmarks, yet existing evaluation practices largely rely on coarse summary metrics that obscure underlying reasoning abilities. In this work, we propose novel methodologies to adapt cognitive diagnosis models (CDMs) in psychometrics to LLM evaluation, enabling fine-grained diagnosis via multidimensional discrete capability profiles and interpretable characterizations of LLM strengths and weaknesses. First, to enable CDM-based evaluation at benchmark scale (more than 1000 items), we propose a scalable method that jointly estimates LLM mastery profiles and the item-attribute Q-matrix, addressing key challenges posed by high-dimensional latent attributes (K > 20), large item pools, and the prohibitive computational cost of existing marginal maximum likelihood-based estimation. Second, we incorporate item-level textual information to construct AI-embedding-informed priors for the Q-matrix, stabilizing high-dimensional estimation while reducing reliance on costly human specification. We develop an efficient stochastic-approximation algorithm to jointly estimate LLM mastery profiles and the Q-matrix that balances data fit with text-embedding-informed priors. Simulation studies demonstrate accurate parameter recovery. An application to the MATH Level 5 benchmark illustrates the practical utility of our method for LLM evaluation and uncovers useful insights into LLMs' fine-grained capabilities.

연구 동기 및 목표

  • LLM 평가를 위한 집계 정확도를 넘어 구조화되고 다차원적인 역량 프로파일을 제시하려는 동기를 부여한다.
  • 아이템-텍스트 임베딩을 활용하여 사전 구조를 반영하는 확장 가능한 Q-매트릭스 학습을 개발한다.
  • N개의 관찰자 하에서 고차원 K 및 대규모 항목 풀 J에 확장되는 공동 추정 알고리즘을 제안한다.
  • 고차원 벤치마크 규모의 시나리오에서 이론적 일관성 보장을 제공한다.
  • 대형 수학 벤치마크에서 실용적 유용성을 입증하여 미세한 LLM 역량을 드러낸다.

제안 방법

  • 아이템 응답을 다차원 잠재 속성 프로필에 연결하기 위해 DINA 인지 진단 모델을 도입한다.
  • BERTopic와 UMAP 및 계층적 클러스터링을 사용하여 아이템-질문-해결 임베딩으로부터 임베딩 정보에 기반한 기준 Q-매트릭스 Q^(R)을 구성한다.
  • MAP 프레임워크 내에서 Q-매트릭스 추정을 이끄는 사전 P(Q | Q^(R))를 도입한다.
  • 사전하에서 잠재 속성 A, Q, 항목 파라미터 (c, g)를 반복적으로 업데이트하는 확장 가능한 확률근사 EM(SAEM) 알고리즘을 개발한다.
  • 항목 분리도와 사전 강도에 의존하는 비율로 N, J, K가 발산하는 삼중 점근적 구간에서 일관성 결과를 증명한다.
  • 높은 K(15, 30) 및 큰 J(1000, 2000)에서의 시뮬레이션에서 파라미터 복구 및 Q-매트릭스 학습 성능을 입증하고, 2,765개의 LLM과 903개의 항목이 포함된 MATH Level 5 벤치마크에 적용한다.

실험 결과

연구 질문

  • RQ1임베딩 기반 텍스트 priors로 보강된 응답 데이터로부터 대규모로 Q-매트릭스를 학습할 수 있는가?
  • RQ2임베딩 기반 사전 가이드가 LLM 평가에서 고차원 CDM의 안정성 및 해석가능성을 개선하는가?
  • RQ3N, J, K가 함께 증가할 때 공동 SAEM 추정기가 잠재 속성 프로필과 Q-매트릭스 항목을 일관되게 복구할 수 있는가?
  • RQ4대형 벤치마크인 MATH Level 5에서 LLM의 미세한 역량이 의미론적으로 의미 있는 속성 클러스터로 어떻게 조직될까?

주요 결과

  • 임베딩 유도 Q^(R)은 학습된 Q-매트릭스에 반영된 의미적으로 일관된 역량 그룹으로 아이템을 분할한다.
  • 임베딩 정보가 반영된 MAP 추정기가 2^K 잠재 프로필을 열거하지 않고도 A와 Q의 확장 가능한 업데이트를 제공한다.
  • SAEM은 N, J, K에 대해 선형적으로 확장되며 고차원 구역에서 정확한 파라미터 복구를 달성한다.
  • 시뮬레이션 연구는 K=15 또는 30 및 J가 최대 2000일 때도 다양한 N에서 Q-매트릭스와 잠재 프로필 복구가 정확함을 보여준다.
  • MATH Level 5에 2,765개의 LLM 및 903개의 항목을 적용하면 해석 가능한 속성 라벨과 'prior agreement', 'procedural augmentation', '구조적 재분류' 등의 패턴이 포함된 28-그룹 Q-매트릭스가 도출된다.
  • 이론적 일관성 결과(Theorem 1)는 높은 차원의 공동 증가 N, J, K 하에서 명시적 유한 표본 속도와 함께 회복 보장을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.