Lire une courbe de perte d'entraînement et ce qu'elle révèle

Quand vous entraînez un modèle sur plusieurs itérations, la perte — une mesure de l'erreur de prédiction sur les données d'entraînement — est tracée en fonction du numéro d'itération. Cette courbe est un outil de diagnostic. Sa forme indique si le modèle apprend, s'il a convergé, et si quelque chose s'est mal passé, avant même de regarder un chiffre de précision final.
À quoi ressemble une courbe saine
Une courbe de perte d'entraînement saine commence haute et diminue au fil des itérations, pour finir par s'aplatir en plateau. Le plateau signifie que le modèle a convergé : les itérations supplémentaires ne réduisent plus la perte de façon significative. Si vous tracez aussi la perte de validation, elle devrait diminuer avec la perte d'entraînement et s'aplatir. Un écart entre les deux — perte d'entraînement bien plus basse que la perte de validation — signale un surapprentissage.
Un exemple concret avec des chiffres
Supposons que la perte d'entraînement passe de 2,1, 1,4, 0,9, 0,6, 0,45, 0,42, 0,41, 0,41 sur huit époques. La courbe chute fortement, puis s'aplatit autour de 0,41 — convergence. Si la perte de validation passe de 2,2, 1,5, 1,0, 0,8, 0,75, 0,78, 0,82, 0,85, elle diminue puis commence à monter — un signe de surapprentissage après l'époque 4. Le point où la perte de validation est la plus basse est celui où vous pourriez arrêter l'entraînement. Si la perte d'entraînement reste près de 2,0 et bouge à peine, le modèle n'apprend pas — possiblement un gradient cassé, un taux d'apprentissage trop bas, ou des variables sans signal.
Ce que signifie une courbe divergente
Si la perte augmente ou oscille violemment, le modèle diverge — souvent à cause d'un taux d'apprentissage trop élevé. La solution est de réduire le taux d'apprentissage ou d'utiliser l'écrêtage de gradient. Une perte plate dès le départ qui ne diminue jamais suggère que le modèle n'apprend pas du tout, ce qui pointe vers des problèmes d'initialisation, de données ou de variables plutôt que de durée d'entraînement.
Erreurs courantes
Une erreur est de faire confiance au chiffre de perte final sans regarder la courbe — une perte finale basse avec une perte de validation montante est du surapprentissage, pas un succès. Une autre est d'arrêter trop tôt, avant la convergence. Une troisième est de comparer des valeurs de perte entre fonctions de perte ou échelles différentes, ce qui n'a pas de sens. La documentation de scikit-learn sur l'entraînement par descente de gradient stochastique inclut des conseils sur les calendaires de taux d'apprentissage et la convergence (scikit-learn : SGD).
Un exercice
Entraînez un modèle et tracez la perte d'entraînement et de validation par époque. Identifiez le plateau de convergence et le point où la perte de validation commence à monter. Réentraînez avec arrêt anticipé à ce point et comparez. Pour le parcours d'apprentissage plus large, voir les aperçus du programme d'IA appliquée ou le programme d'analyse de données.
Collège Unica
Ressources pédagogiques du Collège Unica — guides pratiques pour l'IA appliquée et l'analyse de données.
