[논문 리뷰] On the expressiveness and spectral bias of KANs
이 논문은 이론적·실험적으로 콜모고로프-아르놀드 네트워크(KANs)와 다층 퍼셉트론(MLPs)을 비교하며, KANs가 표현력이 같거나 뛰어나면서도 상당히 감소된 스펙트럴 바이어스를 보임을 보여준다. KANs는 스퍼인 기반의 학습 가능한 활성화 함수 덕분에 고주파 함수와 PDE에서 더 나은 성능을 발휘한다.
Kolmogorov-Arnold Networks (KAN) \cite{liu2024kan} were very recently proposed as a potential alternative to the prevalent architectural backbone of many deep learning models, the multi-layer perceptron (MLP). KANs have seen success in various tasks of AI for science, with their empirical efficiency and accuracy demostrated in function regression, PDE solving, and many more scientific problems. In this article, we revisit the comparison of KANs and MLPs, with emphasis on a theoretical perspective. On the one hand, we compare the representation and approximation capabilities of KANs and MLPs. We establish that MLPs can be represented using KANs of a comparable size. This shows that the approximation and representation capabilities of KANs are at least as good as MLPs. Conversely, we show that KANs can be represented using MLPs, but that in this representation the number of parameters increases by a factor of the KAN grid size. This suggests that KANs with a large grid size may be more efficient than MLPs at approximating certain functions. On the other hand, from the perspective of learning and optimization, we study the spectral bias of KANs compared with MLPs. We demonstrate that KANs are less biased toward low frequencies than MLPs. We highlight that the multi-level learning feature specific to KANs, i.e. grid extension of splines, improves the learning process for high-frequency components. Detailed comparisons with different choices of depth, width, and grid sizes of KANs are made, shedding some light on how to choose the hyperparameters in practice.
연구 동기 및 목표
- KANs의 근사 및 표현 능력이 MLP에 비해 이론적으로 분석되도록 한다.
- 특히 과학 기반 기계 학습의 맥락에서 KANs와 MLP 간의 스펙트럴 바이어스 현상에 대해 연구한다.
- KANs가 고주파 함수를 풀거나 PDE를 해결하는 데 성공한 이유를 이론적·실험적으로 설명한다.
- 깊이, 너비, 격자 크기의 영향을 분석하여 KANs의 하이퍼파rameter 선택을 안내한다.
- KANs가 과적합에 더 취약한 이유를 설명하고, 격자 굵기 조정이 이를 완화하는 방법을 제시한다.
제안 방법
- 모든 ReLU 활성화를 가진 MLP가 KAN으로 재매개변수화될 수 있음을 증명하여, KANs의 표현력이 MLP와 동일하거나 더 뛰어나다는 것을 입증한다.
- KAN을 MLP로 표현하는 방법을 제시하며, 매개변수 수가 KAN의 격자 크기 비례로 증가함을 보여준다.
- 단일 KAN 레이어에서의 경사 하강법 역학을 분석하여, KANs가 저주파수 측면으로 강한 스펙트럴 바이어스를 보이지 않는다는 것을 주장한다.
- 1D 주파수 피팅, 가우시안 랜덤 필드, 고주파 해를 가진 1D 포아송 방정식에서의 수치 실험을 통해 스펙트럴 바이어스와 일반화 능력을 비교한다.
- KANs에서 격자 확장을 적용하여 스퍼인 근사치를 정밀화하고 고주파 성분 학습을 향상시킨다.
- 합성 데이터 및 PDE 데이터셋에서 평균 제곱오차 손실을 사용한 LBFGS 최적화를 통해 다양한 아키텍처와 하이퍼파ram터에서의 학습 및 테스트 성능을 평가한다.

실험 결과
연구 질문
- RQ1KANs는 MLP가 근사할 수 있는 모든 함수를 유사한 매개변수 효율성으로 근사할 수 있는가?
- RQ2학습 중 KANs의 스펙트럴 바이어스는 표준 MLP와 비교해 어떻게 다른가?
- RQ3KANs에서 격자 확장이 고주파 성분 학습에 얼마나 기여하는가?
- RQ4왜 KANs가 과적합 경향을 보이며, 하이퍼파ram터 조정을 통해 이를 어떻게 완화할 수 있는가?
- RQ5KANs의 감소된 스펙트럴 바이어스가 고주파 PDE를 해결하는 과학 계산 작업에서 성능 향상으로 이어지는가?
주요 결과
- KANs는 매개변수 수가 유사한 수준에서 모든 ReLU 활성화를 가진 MLP를 표현할 수 있으며, 이는 KANs의 표현력이 MLP와 동일하거나 더 뛰어나다는 것을 시사한다.
- 반대로, KAN을 MLP로 표현하면 매개변수 수가 KAN의 격자 크기 비례로 증가하므로, 큰 격자 크기를 가진 KANs에서는 효율성 향상 가능성이 있다.
- 단일 KAN 레이어에서의 경사 하강법 이론적 분석 결과, KANs는 MLP와 달리 저주파수 측면으로 강한 스펙트럴 바이어스를 보이지 않음을 확인했다.
- 실험 결과에 따르면, KANs는 고주파 함수 근사 및 PDE에서 항상 MLP를 능가하며, 주파수가 높아질수록 성능 격차가 커진다.
- KANs의 과적합 경향은 노이즈가 많거나 복잡한 데이터에서 두드러지지만, 격자 굵기 조정을 통해 이를 줄일 수 있으며 이는 스펙트럴 바이어스를 증가시킨다.
- 학습 데이터 크기를 늘리면 KAN의 과적합이 크게 감소하며, 격자 확장은 거친 또는 저해상도 함수에서의 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.