[Paper Review] Towards Understanding Generalization in Gradient-Based Meta-Learning
This paper investigates generalization in gradient-based meta-learning, particularly MAML, and challenges the conventional link between flat minima and generalization. It proposes a novel regularizer based on coherence of adaptation trajectories—measured by cosine similarity of inner-loop update directions—which improves meta-test accuracy by 1.33 percentage points (94.05% to 95.38%) on Omniglot 20-way 1-shot, demonstrating that trajectory coherence, not flatness, correlates with generalization.
Dans ce mémoire, nous étudions la généralisation des réseaux de neurones dans le contexte du méta-apprentissage, en analysant divers propriétés des surface leurs fonctions objectifs. La recherche en apprentissage automatique portant sur les surfaces de fonctions objectifs des réseaux de neurones ayant aidé à comprendre leur généralisation en apprentissage supervisé standard, nous proposons l'étude de telles surfaces dans le but d'approfondir nos connaissances sur la généralisation en méta-apprentissage. Nous introduisons d'abord la littérature sur les fonctions objectifs des réseaux de neurones à la Section ef{sec:intro:objective_landscapes}, puis celle portant sur le méta-apprentissage à la Section ef{sec:intro:meta-learning}, pour enfin terminer notre introduction avec le méta-apprentissage par descente de gradient, très similaire à l'entraînement des réseaux de neurones par descente de gradient stochastique et pour une tâche unique. Nous présentons par la suite notre travail sur les fonctions objectifs en méta-apprentissage au Chapitre ef{chap:prof_forcing}, lequel nous avons soumis à la conférence NeurIPS 2019 en tant qu'article scientifique. Au moment d'écrire ce mémoire, et au meilleur de notre connaissance, ce travail est le premier à étudier empiriquement les surfaces des fonctions objectifs en méta-apprentissage, particulièrement dans le contexte de l'apprentissage profond, et nous mettons notamment en lumière certaines propriétés de ces surfaces qui apparaissent liées à la généralisation des réseaux de neurones à de nouvelles tâches. Nous démontrons empiriquement qu'alors que progresse la phase de méta-entraînement, pour les solutions aux nouvelles tâches obtenues via quelques itérations de descente de gradient, la courbure de la fonction objective décroit monotoniquement, la valeur de la fonction objective diminue, tandis que la distance euclidienne avec la solution ``méta-entraînement" augmente. Cependant, nous observons que la courbure des minima continue de décroître même lorsque le sur-apprentissage devient apparent et que la généralisation commence à se dégrader, indiquant que la courbure des minima semble peu corrélée à la généralisation en méta-apprentissage par descente de gradient. De plus, nous montrons empiriquement que la généralisation aux nouvelles tâches semble plutôt liée à la cohérence de leurs trajectoires d'adaptation dans l'espace des paramètres, mesurée par la similarité cosinus moyenne entre les trajectoires. Nous montrons également que la cohérence des gradients ''meta-test", mesurée par le produit scalaire moyen entre les vecteurs de gradients spécifiques aux nouvelles tâches, évalué à solution meta-entraînement, est également corrélée à la généralisation. Nous basant sur ces observations, nous proposons un nouveau terme de régularisation pour l'algorithme de méta-apprentissage Model Agnostic Meta-Learning (MAML).
Motivation & Objective
- To understand the optimization landscape properties linked to generalization in gradient-based meta-learning.
- To investigate whether flat minima correlate with generalization in meta-learning, challenging prior assumptions from standard supervised learning.
- To identify alternative, more predictive indicators of generalization in few-shot meta-learning settings.
- To develop a new regularizer for MAML based on empirical insights into adaptation trajectory coherence.
Proposed method
- Analyzes meta-test solutions after few-step gradient adaptation from meta-train weights, tracking flatness, loss, and distance from meta-train solution.
- Measures adaptation trajectory coherence via average cosine similarity between direction vectors of inner-loop updates across tasks.
- Quantifies gradient coherence at meta-train solution using average inner product between task-specific gradients.
- Proposes a regularizer penalizing angular deviation from the average adaptation direction, computed as $\Omega(\theta) = -\vec{\theta}_i^T \vec{\theta}_\mu$.
- Integrates the regularizer into MAML’s inner loop by modifying update directions while keeping meta-update computation unchanged.
- Employs second-order MAML with regularization coefficient $\gamma = 0.5$ on Omniglot 20-way 1-shot for evaluation.
Experimental results
Research questions
- RQ1Does the flatness of meta-test solutions correlate with generalization performance in gradient-based meta-learning?
- RQ2How does the coherence of adaptation trajectories—measured by cosine similarity of update directions—relate to generalization?
- RQ3Is the coherence of meta-test gradients (evaluated at meta-train solution) predictive of generalization?
- RQ4Can a regularizer based on trajectory coherence improve meta-learning generalization in MAML?
- RQ5Does the proposed regularizer outperform standard MAML and fine-tuning baselines in few-shot classification?
Key findings
- As meta-training progresses, meta-test solutions become flatter and achieve lower support loss, but this trend continues even when generalization degrades.
- Generalization performance degrades when meta-training overfits, yet meta-test solutions remain flatter, contradicting the flat minima generalization hypothesis in meta-learning.
- Generalization is strongly correlated with the average cosine similarity between adaptation trajectory directions, with a consistent metric across settings.
- Generalization is also correlated with the average inner product between meta-test gradients evaluated at the meta-train solution.
- The proposed regularizer increases meta-test accuracy from 94.05% to 95.38% on Omniglot 20-way 1-shot, representing a ~23% relative reduction in error.
- The regularizer improves performance without increasing computational overhead, as the penalty is treated as constant during meta-update.
Better researchstarts right now
From reading papers to final review, dramatically reduce your research time.
No credit card · Free plan available
This review was created by AI and reviewed by human editors.