Play Music
    Réserver une visite
    LogoCollège Unica
    IA et technologie

    Lire une matrice de confusion avec un exemple de classes déséquilibrées

    CCollège Unica
    14 septembre 2026
    8 min de lecture
    Lire une matrice de confusion avec un exemple de classes déséquilibrées

    La précision est la première métrique que tout le monde apprend, et c'est l'une des premières qui trompe. Le piège classique est l'ensemble de données déséquilibré : si seulement 5 % de vos exemples appartiennent à la classe qui vous intéresse, un modèle qui prédit « non » à chaque fois obtient 95 % de précision et peut être inutile à son but. La matrice de confusion est le petit tableau qui expose cela en montrant exactement ce que votre modèle a eu juste et faux, classé par classe. Une fois que vous savez la lire, un simple chiffre de précision vous en dit bien moins qu'auparavant.

    Ce que contient réellement une matrice de confusion

    Pour un problème binaire, la matrice est une grille deux par deux. Les lignes sont les vraies étiquettes, les colonnes sont les étiquettes prédites, et chaque cellule compte des exemples. Les vrais négatifs sont en haut à gauche : le modèle a dit « non » et la vérité était « non ». Les vrais positifs sont en bas à droite : le modèle a dit « oui » et la vérité était « oui ». Les cellules hors diagonale sont les erreurs : les faux positifs (prédit « oui », vraiment « non ») et les faux négatifs (prédit « non », vraiment « oui »). La précision est la somme de la diagonale divisée par le tout. La matrice compte parce qu'elle garde les deux types d'erreurs séparés, et dans le monde réel ces deux erreurs coûtent presque toujours des montants différents.

    Un exemple concret : quand la précision trompe

    Imaginez un détecteur de fraude sur 1 000 transactions, dont 50 sont frauduleuses et 950 légitimes. Un modèle qui prédit « légitime » pour chaque transaction produit cette matrice : 950 vrais négatifs, 0 vrais positifs, 0 faux positifs et 50 faux négatifs. La précision est de 950 sur 1 000, soit 95 % — un chiffre qui semble solide jusqu'à ce que vous réalisiez que le modèle a attrapé zéro fraude. La matrice de confusion rend l'échec évident : la cellule des vrais positifs est vide. C'est pourquoi la précision seule est un résumé faible sur des données déséquilibrées — elle peut récompenser un modèle d'ignorer entièrement la classe rare. La documentation officielle de scikit-learn sur confusion_matrix montre la disposition exacte et un appel concret (scikit-learn : confusion_matrix).

    Les deux questions que la matrice vous force à poser

    Une fois que vous voyez les quatre cellules, deux questions dérivées deviennent inévitables. Le rappel demande : sur tous les vrais cas de fraude, combien avons-nous attrapés ? Dans l'exemple, c'est 0 sur 50, soit 0 % — le signal que le modèle est inutile à son but. La précision demande : sur tous les cas que nous avons signalés comme fraude, combien l'étaient vraiment ? Ici, elle est indéfinie (nous n'en avons signalé aucun), mais dans un modèle qui signale 30 cas dont 20 sont réels, la précision est de 20 sur 30, soit environ 67 %. Le rappel et la précision s'opposent : on peut souvent augmenter le rappel en signalant plus de cas, mais cela baisse généralement la précision parce qu'on signale plus de transactions innocentes. La matrice de confusion est ce qui permet de voir ce compromis au lieu de le deviner.

    Comment baisser le seuil déplace réellement les cellules

    Beaucoup de classifieurs produisent un score plutôt qu'une étiquette ferme ; vous choisissez un seuil pour convertir les scores en décisions oui/non. Sur des scores et des données fixes, baisser le seuil signifie que les prédictions positives sont non décroissantes : les faux négatifs peuvent baisser ou rester les mêmes, et les faux positifs peuvent monter ou rester les mêmes. Le rappel est non décroissant lorsqu'il est défini, et le taux de faux positifs est non décroissant. Mais la précision n'est pas garantie de baisser — elle peut augmenter, diminuer ou rester la même selon l'équilibre des classes et l'endroit où se trouve le seuil. La précision (métrique) n'est pas garantie d'être monotone non plus. Les scores eux-mêmes ne sont pas nécessairement des probabilités calibrées ; ils classent les cas mais peuvent ne pas correspondre à de vraies vraisemblances. Le guide officiel de scikit-learn sur le réglage du seuil de décision explique la distinction entre le problème statistique de prédire des scores et le problème de décision d'agir sur eux (scikit-learn : réglage du seuil de décision).

    Erreurs courantes en lisant la matrice

    Une erreur est de rapporter la précision sur un problème déséquilibré sans jamais regarder la matrice. Une autre est de confondre les axes : certaines bibliothèques mettent les prédictions en lignes et la vérité en colonnes, donc vérifiez toujours les étiquettes avant d'interpréter. Une troisième est d'ignorer l'asymétrie des coûts : en fraude, un faux négatif (fraude manquée) peut coûter des milliers, tandis qu'un faux positif (une transaction légitime signalée) peut retarder ou bloquer une activité valide et coûter une révision manuelle. Le « meilleur » seuil dépend de ces coûts, pas de la métrique qui a l'air bonne. Un modèle avec 40 % de rappel mais 99 % de précision peut être plus utile qu'un modèle avec 90 % de rappel et 10 % de précision, selon ce que coûte une fausse alerte à votre équipe.

    Un exercice : trouvez l'échec caché

    Prenez n'importe quel classifieur sur un ensemble de données déséquilibré et affichez sa matrice de confusion. Calculez la précision, puis calculez le rappel de la classe minoritaire. Si la précision est élevée mais que le rappel de la classe minoritaire est proche de zéro, vous avez trouvé un modèle qui semble réussir tout en échouant à son but réel. Essayez ensuite de baisser le seuil de décision — signalez un cas comme fraude à un score plus bas — et observez comment la matrice évolue : les faux négatifs peuvent baisser, les faux positifs peuvent monter, et la précision peut bouger dans un sens ou dans l'autre. Décidez, compte tenu des coûts réels, quelle version vous déploieriez vraiment.

    Votre prochaine étape

    Lire une matrice de confusion est la fondation ; la prochaine étape est de choisir la bonne métrique quand les faux positifs et les faux négatifs coûtent des choses différentes — précision, rappel et F1. C'est le sujet d'un article ultérieur de cette série. Pour le parcours d'apprentissage plus large, parcourez les aperçus du programme d'IA appliquée ou le programme d'analyse de données.

    C

    Collège Unica

    Ressources pédagogiques du Collège Unica — guides pratiques pour l'IA appliquée et l'analyse de données.

    Articles connexes

    Prêt à commencer votre programme ?

    Réservez une visite gratuite des studios à Westmount ou découvrez nos programmes d'AEC.

    Réserver une visiteVoir les programmes

    Subscribe to our Newsletter

    Get the latest insights on audio engineering, game sound, and AI technology delivered straight to your inbox.

    By subscribing, you agree to our Privacy Policy and consent to receive updates from Collège Unica.

    Avatar
    Bonjour Hi