[논문 리뷰] fKAN: Fractional Kolmogorov-Arnold Networks with trainable Jacobi basis functions
이 논문은 고유한 신경망 아키텍처인 fKAN을 소개한다. fKAN은 기존의 고정된 활성화 함수 대신, 콜모고로프-아르놀드 네트워크(Kolmogorov-Arnold Network, KAN) 프레임워크 내에서 학습 가능한 분수계 수직 자지 다항식 기반 함수를 도입한다. 분수계 자지 다항식의 수학적 성질—예를 들어 간단한 도함수와 비다항성—을 활용하여, 회귀, 이미지 노이즈 제거, 상미분방정식, 편미분방정식, 분수계 지연 미분방정식을 포함한 다양한 딥러닝 및 물리기반 학습 과제에서 표준 KAN과 다른 활성화 함수보다 더 빠른 학습 속도와 높은 정확도를 달성한다.
Recent advancements in neural network design have given rise to the development of Kolmogorov-Arnold Networks (KANs), which enhance speed, interpretability, and precision. This paper presents the Fractional Kolmogorov-Arnold Network (fKAN), a novel neural network architecture that incorporates the distinctive attributes of KANs with a trainable adaptive fractional-orthogonal Jacobi function as its basis function. By leveraging the unique mathematical properties of fractional Jacobi functions, including simple derivative formulas, non-polynomial behavior, and activity for both positive and negative input values, this approach ensures efficient learning and enhanced accuracy. The proposed architecture is evaluated across a range of tasks in deep learning and physics-informed deep learning. Precision is tested on synthetic regression data, image classification, image denoising, and sentiment analysis. Additionally, the performance is measured on various differential equations, including ordinary, partial, and fractional delay differential equations. The results demonstrate that integrating fractional Jacobi functions into KANs significantly improves training speed and performance across diverse fields and applications.
연구 동기 및 목표
- 분수계 수직 자지 다항식을 학습 가능한 활성화 함수로 통합함으로써, 설명 가능성, 정확도, 학습 속도를 향상시키는 새로운 신경망 아키텍처를 개발하는 것.
- 고정된 활성화 함수(예: ReLU의 죽은 뉴런 문제)와 기존 KAN의 한계를 해결하기 위해, 비다항성과 단순한 도함수를 지닌 더 유연하고 적응형 기저 함수를 도입하는 것.
- 다양한 딥러닝 및 물리기반 학습 과제—예를 들어 회귀, 이미지 분류, 노이즈 제거, 미분방정식 해법—에서 제안된 fKAN 모델의 성능을 평가하는 것.
- 분수계 수직 자지 함수가 표준 KAN과 다른 활성화 함수보다 정확도와 수렴 속도 측면에서 뛰어난 성능을 보이는 효과적인 학습 가능한 기저 함수로 기능할 수 있음을 입증하는 것.
- 복잡한 미분방정식, 특히 분수계 지연 미분방정식을 해결하기 위해 신경망 레이어에서 분수계 도함수를 사용하는 것이 타당하고 성능이 뛰어나다는 것을 탐색하는 것.
제안 방법
- fKAN 아키텍처는 KAN의 표준 스퍼인 기반 1차원 함수를 학습 가능한 분수계 수직 자지 기저 함수로 대체하여, 비다항적 활성화 학습이 가능한 적응형 구조를 제공한다.
- 기저 함수는 분수계 수직 자지 다항식에서 유도되며, 닫힌 형태의 도함수 표현식을 제공하고, 양수 및 음수 입력 모두에서 활성 상태를 유지한다.
- 모델는 콜모고로프-아르놀드 표현 정리에 기반한 기능 근사 프레임워크를 사용하며, 각 에지에선 선형 가중치 대신 학습된 1차원 함수를 적용한다.
- 물리기반 학습에서 손실 함수는 데이터 손실과 잔차 손실을 포함하며, 특히 미분방정식 해법에 특화되어 있다.
- 분수계 미분방정식을 해결하기 위해, 하삼각형 미분 운영 행렬을 활용해 카푸토 분수계 도함수를 구현하여 L-BFGS 최적화를 통한 엔드 투 엔드 학습을 가능하게 한다.
- 다층 설계를 채택한 아키텍처는 fJNB(Fractional Jacobi Neural Basis) 레이어를 포함하고, 이후로 완전히 연결된 레이어와 최종 회귀 헤드를 거치며, 입력 차원은 문제에 맞는 변수(예: PDE에서의 시간 및 공간)에 따라 조정된다.

실험 결과
연구 질문
- RQ1분수계 수직 자지 다항식은 다양한 딥러닝 과제에서 성능 향상을 위해 효과적이고 학습 가능한 기저 함수로 기능할 수 있는가?
- RQ2분수계 자지 함수의 통합은 표준 KAN과 고정된 활성화 함수 대비 학습 속도, 일반화 능력, 설명 가능성에 어떤 영향을 미치는가?
- RQ3fKAN은 물리기반 딥러닝 환경에서 일반, 편미분, 분수계 지연 미분방정식을 얼마나 정확하게 해결할 수 있는가?
- RQ4회귀, 이미지 분류, 노이즈 제거 과제에 적용했을 때, fKAN의 정량적 우수성—테스트 정확도 및 수렴 속도 측면에서—는 어떠한가?
- RQ5분수계 자지 함수의 수학적 성질—비다항성과 단순한 도함수—는 신경망 내 최적화 동역학에 어떻게 기여하는가?
주요 결과
- fKAN은 합성 회귀, 이미지 분류, 이미지 노이즈 제거, 감성 분석 과제에서 표준 KAN과 다른 활성화 함수보다 빠른 수렴 속도와 높은 테스트 정확도를 확보한다.
- 모델는 버거스 PDE를 매우 높은 정확도로 해결하며, 테스트한 두 개의 파rameter 조합($m_0=1, m_1=0.01, m_2=0.1$ 및 $m_0=0.1, m_1=0.0001, m_2=0.5$)에 대해 예측 솔루션이 정확한 해와 매우 유사하게 일치한다(그림 10 참조).
- 분수계 지연 미분방정식의 경우, fKAN은 낮은 잔차 오차로 해를 효과적으로 근사했지만, 다중-fJNB 아키텍처의 복잡성으로 인해 잔차에 진동이 관찰되었다.
- 분수계 수직 자지 기저 함수의 사용은 분수계 도함수를 포함한 문제에서 비다항성과 비선형 패턴을 효과적으로 학습할 수 있도록 한다.
- 기저 함수의 전역 성질로 인해 표준 KAN보다 시간 복잡도는 높고 설명 가능성은 낮지만, 평가된 모든 과제에서 베이스라인 모델을 초월하는 성능을 보였다.
- 모델 성능은 다양한 네트워크 깊이와 너비에서 뛰어난 안정성을 보이며, 고정 또는 표준 KAN 기저 함수 대비 학습 가능한 분수계 수직 자지 함수를 사용할 경우 손실과 정확도 측면에서 일관된 향상이 이루어진다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.