Établir un modèle de référence simple avant d'entraîner un modèle d'apprentissage automatique

Avant d'entraîner un modèle, répondez à une question : quelle est la prédiction la plus simple qui fait encore un travail raisonnable ? Cette prédiction est votre modèle de référence (baseline), et c'est l'un des chiffres les plus importants de votre projet. Un modèle qui bat le modèle de référence peut valoir la peine d'être déployé ; un modèle qui ne le bat pas peut n'être qu'une façon coûteuse de faire ce qu'une règle d'une ligne fait déjà. Construire d'abord un modèle de référence évite de passer des semaines sur un modèle qui s'avère n'ajouter que peu de chose par rapport à une règle simple.
Pourquoi un modèle de référence compte plus qu'un modèle astucieux
Un modèle de référence ancre chaque affirmation ultérieure. Quand vous dites « notre modèle atteint 88 % de précision », le chiffre signifie peu isolément. Si le modèle de référence — toujours prédire la classe la plus fréquente — obtient déjà 86 %, la contribution réelle de votre modèle est de deux points, pas de quatre-vingt-huit. Le modèle de référence convertit un chiffre de vanité en un chiffre plus honnête. Il indique aussi où se trouve le plafond du « facile », ce qui vous empêche de célébrer un résultat qui ne demandait aucune intelligence pour être produit. Qu'un gain de deux points justifie un déploiement dépend du coût des erreurs et de l'incertitude entourant l'estimation, et non du seul chiffre principal.
Trois modèles de référence à connaître
Pour la classification, le modèle de référence le plus simple est la classe majoritaire : prédire toujours la catégorie la plus fréquente. Si 70 % des billets de soutien sont non urgents, « toujours prédire non urgent » obtient 70 % de précision gratuitement. Pour la régression, deux modèles de référence simples utilisent le centre de la cible d'entraînement : la moyenne minimise l'erreur quadratique moyenne, tandis que la médiane minimise l'erreur absolue moyenne. Si le compte moyen d'écoutes sur 14 jours est de 6 200, prédire 6 200 pour chaque piste donne un modèle de référence d'erreur quadratique moyenne à battre ; prédire la médiane d'entraînement donne un modèle de référence d'erreur absolue moyenne. Un modèle de référence légèrement plus fort est la « moyenne de groupe » : prédire la moyenne du genre de la piste. Ces calculs prennent quelques minutes et révèlent immédiatement si vos variables ajoutent de l'information. Déduisez toujours le modèle de référence des données d'entraînement uniquement, pour que la comparaison soit honnête.
Un exemple concret avec des comptes cohérents
Imaginez 200 billets de soutien étiquetés urgents ou non, dont 40 urgents (20 %) et 160 non urgents (80 %). Le modèle de référence de classe majoritaire prédit « non urgent » pour les 200 et obtient 80 % de précision. Vous entraînez ensuite une régression logistique qui atteint 84 % de précision. Sans le modèle de référence, 84 % semble impressionnant ; avec lui, vous voyez que le gain est de quatre points. Regardez de plus près : sur les 40 billets vraiment urgents, supposons que le modèle en ait attrapé 12 et manqué 28. Les comptes doivent être cohérents : 12 vrais positifs, 28 faux négatifs, et les 160 prédictions non urgentes restantes se répartissent en 156 vrais négatifs et 4 faux positifs (156 + 4 = 160), ce qui concorde (12 + 28 + 156 + 4 = 200). Le modèle de référence en avait attrapé zéro. Donc, bien que la précision globale ait à peine bougé, le modèle a trouvé 12 cas urgents que le modèle de référence ne pouvait jamais trouver — ce qui peut compter bien plus que le chiffre principal, selon ce que coûte un billet urgent manqué.
Erreurs courantes avec les modèles de référence
La première erreur est de calculer le modèle de référence sur le mauvais découpage — si vous calculez « la classe la plus fréquente » sur l'ensemble complet incluant le test, vous avez fait fuiter de l'information et votre comparaison est malhonnête. Déduisez toujours le modèle de référence des données d'entraînement uniquement. La deuxième est de choisir un modèle de référence si faible qu'il n'est pas informatif : un modèle de référence aléatoire peut toutefois être diagnostique — il indique si votre dispositif d'évaluation et votre métrique se comportent comme prévu —, mais il constitue rarement une référence équitable pour un vrai modèle. La troisième, et la plus courante, est de n'en construire aucun et de présenter ensuite la précision brute du modèle comme si elle était significative. La documentation officielle de scikit-learn sur train_test_split est une bonne référence pour découper proprement les données avant de calculer un modèle de référence ou un score de modèle (scikit-learn : train_test_split).
Un exercice : comparez le modèle de référence et le modèle sur la validation
Choisissez un ensemble de données avec une cible claire. Mettez d'abord de côté un ensemble de test. Du reste, mettez de côté un ensemble de validation. Calculez le modèle de référence de classe majoritaire (ou de médiane d'entraînement) et notez son score sur l'ensemble de validation. Écrivez ensuite la règle non triviale la plus simple que vous puissiez imaginer en utilisant une seule variable — par exemple, « prédire urgent si l'objet du billet contient le mot "brisé" » — et mesurez-la sur la validation aussi. Entraînez un modèle et comparez-le aux deux sur la validation pendant que vous itérez. Ce n'est qu'une fois satisfait que vous devriez exécuter le modèle choisi une fois sur l'ensemble de test mis de côté pour une comparaison finale. L'exercice porte sur l'apprentissage de la question, à chaque fois : « ai-je vraiment battu la version simple, et d'assez pour que cela compte vu le coût des erreurs ? »
Votre prochaine étape
Une fois que vous avez un modèle de référence et un modèle qui le bat honnêtement, la prochaine question est de savoir si votre score de test est digne de confiance — ce qui dépend entièrement de la façon dont vous avez découpé vos données. C'est le sujet du prochain article, sur les ensembles d'entraînement, de validation et de test sans fuite de données. Pour voir comment les modèles de référence s'inscrivent dans un flux d'IA appliquée complet, parcourez les aperçus du programme d'IA appliquée ou le programme d'analyse de données.
Collège Unica
Ressources pédagogiques du Collège Unica — guides pratiques pour l'IA appliquée et l'analyse de données.
