Visualiser et faire le pont
Département de Mathématiques et Informatique, Faculté des Sciences et Techniques, Université Cheikh Anta Diop de Dakar
De quoi parle cette séance
Jusqu’ici, on a appris à calculer sur des données. Aujourd’hui, on apprend à les regarder — et à comprendre ce qu’un graphique dit, ou ne dit pas. C’est la dernière étape avant le Machine Learning.
Trois fruits, trois mesures
On a pesé et mesuré 10 mangues, 10 bananes et 10 oranges. Pour chaque fruit : sa masse (g), sa longueur (cm) et son taux de sucre (%).
fruit masse longueur sucre
0 mangue 301 10.3 14.7
1 banane 137 18.4 11.1
2 orange 201 8.1 9.2
Une ligne = un fruit. Une colonne = une mesure. C’est la forme de toute table de données, et celle que le Machine Learning attend.
Une question simple
Deux paniers de fruits ont exactement la même masse moyenne : 200 g. Contiennent-ils la même chose ?
Avec les seuls chiffres, impossible de répondre : la moyenne est identique. Il faut regarder la répartition — c’est-à-dire compter combien de fruits se trouvent dans chaque tranche de masse.
Deux paniers de masse moyenne identique (200 g), mais de composition totalement différente.
À retenir
Une moyenne résume, mais elle cache la forme des données. Deux jeux très différents peuvent avoir la même moyenne : il faut regarder avant de conclure.
C’est pourquoi visualiser est le premier réflexe de tout travail sur des données — avant le moindre calcul savant.
Tout graphique se lit de la même façon : un titre, deux axes légendés, et des formes qui portent l’information.
L’erreur la plus fréquente
Un graphique sans titre ni unités est illisible : « 300 » de quoi ? des grammes, des francs, des fruits ?
title : ce que l’on regarde.xlabel et ylabel : ce que représente chaque axe, avec l’unité.legend : à quoi correspond chaque couleur, dès qu’il y a des groupes.Trois lignes de code, mais elles font la différence entre une image et une information.
On ne choisit pas un graphique parce qu’il est joli, mais parce qu’il répond à la question que l’on se pose.
La bonne habitude
Formuler la question en français d’abord. Le choix du graphique en découle, et le code n’est plus qu’une formalité.
L’idée en une phrase
L’histogramme découpe l’axe d’une mesure en tranches de même largeur, puis compte combien d’individus tombent dans chaque tranche. La hauteur d’une barre est donc un effectif.
Une image
Comme si l’on rangeait les fruits dans des casiers étiquetés « 100–120 g », « 120–140 g »… puis qu’on comptait les fruits de chaque casier.
Attention : les barres se touchent, car la mesure est continue — c’est ce qui le distingue du diagramme en barres.
L’interprétation
Trois amas \(=\) trois familles de fruits. Ce sont les bananes, les oranges et les mangues — alors que la colonne fruit n’a jamais été utilisée pour tracer ce graphique.
bins)C’est un réglage, pas une vérité : changer les tranches change ce que l’on voit. Raison de plus pour toujours indiquer ses choix.
L’idée en une phrase
Le diagramme en barres compare une valeur entre des groupes : une barre par groupe, dont la hauteur est la valeur. Il part toujours d’une agrégation — une moyenne, une somme, un comptage.
La démarche est en deux temps, déjà vus en Séance 7 :
groupby("fruit")["masse"].mean().
Les chiffres
Mangue : 304 g en moyenne. Orange : 204 g. Banane : 119 g.
C’est le complément de l’histogramme, pas son remplaçant : l’un montre la forme, l’autre compare des résumés.
L’idée en une phrase
Le nuage de points place chaque individu selon deux mesures : une en abscisse, une en ordonnée. Chaque point est un fruit ; sa position résume ses deux mesures.
On y cherche deux choses :
En colorant par catégorie, on répond aux deux questions d’un seul regard.
Chaque point est un fruit, placé selon sa longueur et sa masse, coloré selon son type.
Trois amas nettement séparés, sans le moindre chevauchement.
Le point décisif
Les trois groupes ne se touchent pas. Autrement dit : connaître la longueur et la masse suffit à identifier le fruit — sans le voir. C’est exactement ce que le Machine Learning va automatiser.
Quatre gestes, toujours les mêmes
L’analyse exploratoire (EDA) n’est pas une technique, c’est une méthode : comprendre les données avant de modéliser.
shape — combien de lignes, de colonnes ?describe, value_counts — quelles valeurs, quels effectifs, des manques ?Résultat →
masse longueur sucre
fruit
banane 119.0 19.0 11.8
mangue 304.4 10.9 14.0
orange 204.3 8.2 9.0
Trois lignes, trois colonnes : le portrait chiffré de chaque fruit.
Le point clé
Chaque mesure sépare les fruits, à sa manière. La masse distingue bien la mangue ; la longueur, la banane ; le sucre, l’orange. Un modèle exploitera les trois ensemble.
Ce que l’on vient de faire à la main
En regardant le nuage de points, vous avez appris à reconnaître un fruit : « long et léger \(\rightarrow\) banane ». Le Machine Learning, c’est confier cet apprentissage à un programme.
Pour cela, on lui donne les données sous une forme précise :
X — ce que l’on observe : les mesures (masse, longueur, sucre).y — ce que l’on veut prédire : le nom du fruit.X et y
Les colonnes de mesures forment X ; la colonne à prédire forme y.
Une ligne de X et la valeur de y en face décrivent le même fruit.
X et yRésultat →
X shape : (30, 3)
y shape : (30,)
X est une matrice (30, 3) : 30 fruits en lignes, 3 mesures en colonnes. y est un vecteur (30,) : un nom par fruit. Les deux ont forcément le même nombre de lignes.
Sous cette forme, X et y sont exactement ce qu’attend scikit-learn. Ce code n’est pas exécuté ici — il montre où l’on va :
Deux mots pour finir
fit : le modèle apprend sur des fruits déjà étiquetés. predict : il décide pour un fruit nouveau. Tout le cours de Machine Learning consiste à comprendre ce qui se passe entre les deux.
X contient ce que l’on mesure, y ce que l’on cherche à prédire.L’essentiel
Pourquoi : une moyenne cache la forme des données ; un graphique la révèle.
Lequel : une mesure \(\rightarrow\) histogramme ; une mesure par groupe \(\rightarrow\) barres ; deux mesures \(\rightarrow\) nuage de points.
Comment lire : titre, axes légendés avec unités, légende des couleurs ; puis chercher formes, groupes, liens.
Mini-EDA : charger \(\rightarrow\) décrire \(\rightarrow\) tracer \(\rightarrow\) observer.
Pont ML : X (ce que l’on mesure) et y (ce que l’on prédit) ; fit pour apprendre, predict pour décider.
Le chemin parcouru
Des valeurs et des types (S1) aux structures (S2), au contrôle du flux (S3), aux fonctions (S4), aux objets (S5) ; puis à NumPy (S6), pandas (S7) et à la visualisation (S8).
Vous savez désormais charger, explorer, résumer et représenter des données — et vous comprenez ce qu’un modèle attend. Le cours de Machine Learning peut commencer.