Ce que l'apprentissage automatique apprend réellement des données

Un modèle mental courant de l'apprentissage automatique est que le modèle « mémorise les données ». Cette image est trompeuse pour une famille importante — les modèles paramétriques ajustés — mais elle n'est pas fausse pour toutes les méthodes. Cet article porte sur un modèle linéaire paramétrique ajusté, celui obtenu par moindres carrés ordinaires ou régression logistique, pour expliquer ce qui est réellement stocké et ce que cela implique pour votre projet.
Des paramètres, pas des enregistrements — pour un modèle paramétrique ajusté
Pour un modèle linéaire paramétrique ajusté, le résultat de l'apprentissage est un ensemble de nombres : un poids par variable plus une ordonnée à l'origine. L'entraînement ajuste ces paramètres pour qu'une fonction des entrées produise des prédictions proches des étiquettes. Le guide officiel de scikit-learn sur les modèles linéaires décrit ce processus d'ajustement (scikit-learn : modèles linéaires). Il est tentant de dire que le modèle « ne conserve pas de copie de vos lignes », et pour cette famille paramétrique c'est globalement vrai après l'ajustement. Mais ce n'est pas une propriété universelle de l'apprentissage automatique. Les méthodes basées sur les instances, comme les k-plus proches voisins, conservent les exemples d'entraînement eux-mêmes et les consultent au moment de la prédiction — les données sont le modèle. Et même les modèles paramétriques peuvent mémoriser de l'information : un modèle suffisamment souple peut encoder des lignes d'entraînement individuelles dans ses paramètres, donc les paramètres ne garantissent pas la confidentialité. De même, la taille d'un modèle n'est pas nécessairement plus petite que l'ensemble de données ; un grand arbre ou réseau peut détenir plus de structure stockée que les lignes sur lesquelles il a été entraîné.
Un exemple concret : un petit modèle linéaire
Supposons que vous ajustiez un modèle linéaire pour prédire les écoutes sur 14 jours d'une piste à partir de deux variables : le tempo (en BPM) et les écoutes antérieures de l'artiste. Supposons que les moindres carrés ordinaires renvoient les coefficients illustratifs suivants : écoutes prédites = 12 × tempo + 0,001 × écoutes antérieures + 200. Les paramètres sont 12, 0,001 et 200 — explicitement illustratifs, non mesurés. Pour une nouvelle piste de tempo 120 et d'écoutes antérieures de 50 000, le calcul à la main donne : 12 × 120 = 1 440 ; 0,001 × 50 000 = 50 ; plus 200, soit 1 690 écoutes prédites. Vous pouvez ensuite exécuter le modèle ajusté sur la même entrée et comparer : si le modèle est correctement câblé, il renvoie le même 1 690. Cet accord est le point essentiel — la prédiction est une fonction déterministe des paramètres et de l'entrée, et vous pouvez la reproduire à la main.
Linéaire ne garantit pas la généralisation
Une relation à peu près linéaire entre les variables et la cible ne garantit pas, à elle seule, que le modèle généralise. La généralisation dépend de la représentativité des données d'entraînement par rapport aux conditions sur lesquelles vous prédirez, du niveau de bruit, du processus d'échantillonnage et d'une validation honnête sur des données mises de côté. Un modèle linéaire peut bien ajuster une relation réellement linéaire et échouer quand même si les nouvelles données proviennent d'une distribution différente. Inversement, une relation non linéaire ne justifie pas automatiquement un modèle plus souple : un motif non linéaire avec peu de données et beaucoup de bruit peut être mieux servi par un modèle simple régularisé que par un modèle souple qui surapprend. Le choix de la souplesse devrait suivre l'évidence de l'erreur de validation, non l'idée que la non-linéarité exige de la complexité.
Deux modèles sur les mêmes données diffèrent-ils ?
Que deux ajustements sur les mêmes données diffèrent dépend de l'algorithme et du solveur. Les moindres carrés ordinaires déterministes ont une solution analytique : avec les mêmes données, ils renvoient les mêmes paramètres peu importe la graine aléatoire. Le hasard n'entre en jeu que pour les algorithmes qui utilisent l'optimisation stochastique, l'échantillonnage ou l'initialisation aléatoire — certains solveurs, réseaux de neurones, méthodes d'arbres. Pour ceux-là, fixer les graines et rapporter la variance entre les exécutions compte. Le score d'une seule exécution n'est un échantillon d'une distribution de résultats possibles que lorsque l'algorithme est stochastique.
La rétention des données suit les exigences, pas une règle universelle
La possibilité de supprimer les données d'entraînement après l'ajustement n'est pas une propriété technique du modèle. Elle suit les exigences du projet, les obligations de consentement et de gouvernance des données, et les besoins de reproductibilité. Vous pouvez avoir besoin des données pour réentraîner, auditer les décisions, valider sur de nouveaux découpages ou satisfaire une politique de conservation ; vous pouvez être tenu de les supprimer au titre d'obligations de confidentialité. Traitez la rétention comme une décision de gouvernance, non comme quelque chose que la petitesse du modèle permet.
Erreurs courantes
Une erreur est de supposer que tout modèle se débarrasse de ses données d'entraînement — les méthodes basées sur les instances ne le font pas. Une autre est de traiter les paramètres du modèle comme confidentiels par défaut ; un modèle souple peut encoder des lignes sensibles. Une troisième est de supposer qu'un ajustement linéaire généralise sans vérifier la représentativité et la validation. Une quatrième est de recourir à un modèle plus complexe uniquement parce que la relation semble non linéaire.
Un exercice
Ajustez un petit modèle linéaire sur un ensemble de données jouet et affichez les coefficients appris. Prenez une nouvelle entrée, calculez la prédiction à la main avec ces coefficients, et comparez-la à la sortie du modèle sur la même entrée — elles devraient correspondre. Vérifiez ensuite si votre algorithme est stochastique : réentraînez avec une autre graine et voyez si les coefficients changent. Pour le parcours d'apprentissage plus large, voir les aperçus du programme d'IA appliquée ou le programme d'analyse de données.
Collège Unica
Ressources pédagogiques du Collège Unica — guides pratiques pour l'IA appliquée et l'analyse de données.
