[논문 리뷰] A Systematic Evaluation of Sample-Level Tokenization Strategies for MEG Foundation Models
이 논문은 MEG 기초모델에 대해 학습 가능한 샘플 레벨 토크나이제이션과 비학습 가능한 토크나이제이션 전략을 체계적으로 비교하며, 대부분의 기준에서 간단한 고정 토크나이제이션이 학습 가능한 방법과 비슷한 성능을 보이나 주체 지문인식(subject fingerprinting)에서는 학습 가능한 토큰이 도움이 됨을 보여준다.
Recent success in natural language processing has motivated growing interest in large-scale foundation models for neuroimaging data. Such models often require discretization of continuous neural time series data, a process referred to as 'tokenization'. However, the impact of different tokenization strategies for neural data is currently poorly understood. In this work, we present a systematic evaluation of sample-level tokenization strategies for transformer-based large neuroimaging models (LNMs) applied to magnetoencephalography (MEG) data. We compare learnable and non-learnable tokenizers by examining their signal reconstruction fidelity and their impact on subsequent foundation modeling performance (token prediction, biological plausibility of generated data, preservation of subject-specific information, and performance on downstream tasks). For the learnable tokenizer, we introduce a novel approach based on an autoencoder. Experiments were conducted on three publicly available MEG datasets spanning different acquisition sites, scanners, and experimental paradigms. Our results show that both learnable and non-learnable discretization schemes achieve high reconstruction accuracy and broadly comparable performance across most evaluation criteria, suggesting that simple fixed sample-level tokenization strategies can be used in the development of neural foundation models. The code is available at https://github.com/OHBA-analysis/Cho2026_Tokenizer.
연구 동기 및 목표
- MEG 데이터에 대한 기초 모델 방식의 학습 동기를 제시하고 토크나이제이션이 표현 및 다운스트림 작업에 어떤 영향을 주는지 이해한다.
- 재구성, 모델링, 디코딩 작업에 걸쳐 MEG 데이터에서 학습 가능한 토크나이저와 비학습 가능한 토크나이저를 체계적으로 비교한다.
- 간단한 고정 이산화가 효과적인 신경 시계열 기초 모델링에 충분한지 평가한다.
제안 방법
- GRU로 구성된 인코더와 1D 토큰 커널을 사용하는 디코더를 갖춘 autoencoder 류의 VQ-VAE 스타일 프레임워크로 MEG 신호에 맞춘 학습 가능한 샘플 레벨 토크나이저를 제안한다.
- 최적화 중 그래디언트 흐름을 가능하게 하려는 완화된 소프트에서 하드 토큰 배정으로 토크나이저 변종을 학습한다.
- 고정 비학습 기준선 두 가지와 비교한다: μ-transform과 표준 분위수 토크나이저.
- 토크나이즈된 MEG 데이터에서 다음 토큰 예측으로 GPT 스타일의 MEG 기초 모델(MEG-GPT)을 사전학습시키고 여러 기준으로 평가한다.
- 재구성 충실도, 토큰 예측 정확도, 생성 데이터의 생물학적 타당성, 주체 특이 정보 보유 여부, 그리고 다운스트림 디코딩에 대한 토크나이제이션의 영향을 평가한다.

실험 결과
연구 질문
- RQ1학습 가능한 샘플 레벨 토크나이저가 MEG 기초 모델 파이프라인에서 고정 토크나이제이션보다 의미 있는 이점을 제공하는가?
- RQ2토크나이제이션 선택이 재구성 품질 및 제로샷 및 미세조정 디코딩과 같은 다운스트림 작업에 어떤 영향을 미치는가?
- RQ3다양한 데이터 세트와 작업에 대해 단순한 고정 이산화가 강건한 MEG 기초 모델링에 충분한가?
- RQ4학습 가능한 토크나이저가 고정 방식에 비해 주체 지문인식이나 피험자 간 식별력을 개선하는가?
주요 결과
- 학습 가능한 디스크리타이제이션과 비학습 가능한 디스크리타이제이션 모두 재구성 정확도가 높고 대부분의 기준에서 대체로 유사한 성능을 보인다.
- 학습 가능한 토크나이저가 고정 토크나이저에 비해 주체 지문인식에서 일관된 향상을 보인다.
- 고정 샘플 레벨 토크나이제이션 전략은 토큰 예측, 생물학적 타당성, 그리고 다운스트림 디코딩에서 대부분의 설정에서 학습 가능한 토크나이저와 비슷한 성능을 보인다.
- 다양한 취득 사이트와 패러다임을 가진 세 개의 MEG 데이터셋에서 토크나이제이션 선택이 기초 모델의 전체 성능을 크게 바꾸지 않았다.
- 본 연구는 MEG 기초 모델을 위한 샘플 레벨 토크나이저의 최초의 체계적이고 통제된 비교를 제시하며 재현용 코드가 제공된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.