Bases du DataFrame pandas pour les projets d'IA

Presque tout projet d'IA appliquée commence par charger des données dans un DataFrame pandas et les inspecter. Avant toute modélisation, il faut voir la forme, les types de colonnes, les premières lignes et les statistiques de base. Ces opérations sont la fondation de chaque étape ultérieure — nettoyage, ingénierie de variables, découpage et modélisation — et les faire avec soin repère les problèmes tôt.
Chargement et première inspection
Un DataFrame est un tableau avec des colonnes nommées et des lignes indexées. On en charge un avec pd.read_csv pour les fichiers CSV, puis on inspecte avec .head() pour voir les premières lignes, .shape pour le nombre de lignes et de colonnes, .dtypes pour les types de colonnes, et .describe() pour les statistiques sommaires des colonnes numériques. Le guide officiel de démarrage de pandas parcourt ces bases (pandas : démarrage).
Un exemple concret
Supposons que vous chargiez un CSV de 1 000 sorties de pistes. df.shape renvoie (1000, 8) — 1 000 lignes, 8 colonnes. df.dtypes montre que « tempo » est un flottant, « genre » est un objet (chaîne), et « release_date » est aussi un objet — un signe qu'il faudra peut-être le convertir en datetime. df.head() révèle que certaines lignes ont « NaN » dans la colonne prior_streams, ce qui signifie des valeurs manquantes. df.describe() montre que la colonne des écoutes sur 14 jours a une moyenne de 6 200 et un maximum de 150 000 — un signe d'une distribution à longue traîne. Chacune de ces observations mène à une prochaine étape concrète : convertir la date, gérer les valeurs manquantes, et envisager une transformation logarithmique pour la cible.
Sélection et filtrage
On sélectionne une seule colonne avec df["tempo"] et plusieurs colonnes avec df[["tempo", "genre"]]. On filtre les lignes avec une condition : df[df["genre"] == "pop"] renvoie seulement les pistes pop. On combine des conditions avec & et |. Ces opérations permettent d'inspecter des sous-ensembles, ce qui est la façon de trouver des problèmes de qualité de données que les statistiques agrégées cachent.
Erreurs courantes
Une erreur est de sauter l'inspection et de passer directement à la modélisation, pour découvrir bien plus tard qu'une colonne avait un mauvais type ou des valeurs manquantes répandues. Une autre est d'utiliser .describe() seulement sur les colonnes numériques et de rater qu'une colonne catégorielle a 500 valeurs uniques là où on en attendait 10. Une troisième est de modifier une tranche d'un DataFrame sans .copy(), ce qui provoque un SettingWithCopyWarning et une corruption silencieuse des données. Le guide utilisateur de pandas sur l'indexation explique comment l'éviter (pandas : indexation).
Un exercice
Chargez un CSV et exécutez .shape, .dtypes, .head() et .describe(). Notez une observation de chacun qui modifie votre plan. Sélectionnez ensuite une colonne et filtrez les lignes par une condition, et inspectez le résultat. Pour le parcours d'apprentissage plus large, voir les aperçus du programme d'IA appliquée ou le programme d'analyse de données.
Collège Unica
Ressources pédagogiques du Collège Unica — guides pratiques pour l'IA appliquée et l'analyse de données.
