Une analogie, une formule, un exemple chiffré

pédagogie
enseignement
Comment je construis un cours : l’intuition d’abord, le formalisme ensuite, et jamais de résultat inventé.
Date de publication

18 septembre 2026

Richard Feynman raconte qu’il savait compter les secondes dans sa tête tout en lisant, mais qu’il en était incapable dès qu’il parlait. Son collègue John Tukey faisait exactement l’inverse : lui comptait en voyant défiler un ruban de chiffres, et pouvait donc parler en même temps. Même tâche, deux mécaniques mentales incompatibles. Et chacun avait supposé jusque-là que tout le monde faisait comme lui.

Je pense souvent à cette histoire devant un amphithéâtre. Quand une explication ne passe pas, mon premier réflexe est de la redonner, plus lentement. Sauf que l’étudiant qui décroche n’est pas plus lent que les autres. On lui a proposé une porte qui ne s’ouvre pas pour lui, et on lui repropose la même.

Commencer par une image

Alors j’entre par une analogie. Pour le compromis biais-variance, je parle de deux tailleurs : l’un coupe le même costume pour tout le monde, l’autre recommence entièrement dès que son client change de posture. Les étudiants rient, et surtout ils retiennent. L’image devient une rampe à laquelle se tenir quand la formule arrive.

Ensuite, avant toute notation, je dis la chose en une phrase. L’entropie, c’est le désordre, la surprise moyenne. Gini, c’est la probabilité de se tromper en classant au hasard. Cette étape est aussi un test pour moi : quand je n’y arrive pas, c’est que je n’ai pas encore compris la notion assez bien pour l’enseigner.

Ne pas s’arrêter là

C’est ici que beaucoup de cours « accessibles » s’arrêtent, et c’est exactement ce que je veux éviter. Après l’image vient la vraie formule, entière, sans version édulcorée. L’étudiant à qui on a seulement raconté une métaphore se retrouve démuni devant un article ou un sujet d’examen. L’intuition prépare le formalisme ; elle ne le remplace pas.

Je décortique donc la formule symbole par symbole, et je glisse les rappels de mathématiques au moment précis où ils servent : le logarithme en base 2 juste sous l’entropie, la dérivée juste avant la descente de gradient. Placés dans un chapitre préliminaire, personne ne les relit.

Puis j’applique, sur des nombres. Dans mon cours d’apprentissage automatique, l’arbre de décision est construit devant eux sur huit patients : la première coupure, le duel entre les candidates, le calcul du gain, la récursion, les feuilles. À la fin, on lance scikit-learn et on obtient le même arbre. Ce moment-là vaut dix diapositives d’explication : l’objet s’est fabriqué sous leurs yeux, ils ne l’ont pas reçu tout fait.

Suit un exercice, corrigé dans la foulée, et le piège que je sais qu’ils vont rencontrer : la fuite de données dans une validation croisée, la standardisation calculée avant d’avoir séparé les jeux.

Rien ne s’invente

Sur ce point, je ne transige pas : aucune sortie de programme, aucun message d’erreur, aucun résultat chiffré n’est écrit de mémoire sur mes supports. Tout vient d’une exécution réelle. Même les messages d’erreur sont produits exprès, sur du vrai code, avant d’être montrés.

En pratique, cela m’oblige à écrire et exécuter le carnet de code d’abord, et les diapositives ensuite, à partir de ce que j’ai réellement obtenu. C’est plus long, mais la raison est simple : un étudiant qui tape le code du cours et n’obtient pas le résultat annoncé ne se dit pas que le support est faux. Il se dit qu’il est mauvais. Une valeur approximative peut lui coûter des semaines de confiance.

Raconter une histoire, pas dérouler un programme

Une séance ne se tient pas toute seule. Chacune commence par rappeler ce qu’on sait déjà faire et où l’on bute, et se termine en annonçant la limite que la prochaine va lever. « On sait trouver le chemin optimal — à condition de disposer de la carte complète. Que fait-on quand on ignore où sont les obstacles ? » Le cours avance alors comme un récit, avec une tension, au lieu d’être une liste de techniques.

Les mêmes exemples reviennent d’une séance à l’autre. Un jeu de données minuscule croisé au chapitre des arbres réapparaît dans la régression, puis dans les métriques d’évaluation — où l’on découvre qu’un modèle qu’on avait jugé médiocre était simplement mal évalué. Ces retrouvailles font plus pour la compréhension que n’importe quel récapitulatif de fin de chapitre.

Ce que ça coûte

Beaucoup de temps, je ne vais pas le cacher. Un concept traité ainsi demande six passages au lieu d’un, les exemples doivent être calculés à la main puis vérifiés par le code, et les bonnes analogies se cherchent longtemps.

Mais un cours construit comme ça résiste. Ceux qui n’entrent pas par l’image entrent par les chiffres. Ceux que la formule rebute la retrouvent après avoir manipulé l’objet. Plusieurs portes valent mieux qu’une seule, répétée plus fort.

C’est aussi ce que nous essayons de mettre dans la plateforme d’apprentissage adaptatif que nous développons à l’UCAD : adapter non pas la vitesse d’une explication unique, mais la porte par laquelle on entre. Feynman et Tukey l’avaient remarqué en comptant des secondes. Il nous reste à en tirer les conséquences dans nos amphithéâtres.

Retour au sommet