Arrête de tester tes prompts à l'œil
Modifier un prompt sans le mesurer, c'est deviner. Precision, recall, F1 et seuil : les quatre notions qui transforment « ça a l'air mieux » en un chiffre.
4 min de lecture

Tu modifies un prompt. Tu testes 2-3 cas. "Ça a l'air mieux." Tu push.
On a tous fait ça. Et on a tous eu la surprise une semaine plus tard : "pourquoi ça marche moins bien qu'avant ?"
Le problème c'est pas ton prompt. C'est que tu n'as aucun moyen de savoir si c'est vraiment mieux.
Le problème avec "ça a l'air bien"
Quand tu changes un prompt, trois choses peuvent se passer :
- Ça améliore les cas que tu as testés… et ça casse ceux que tu n'as pas testés
- Ça ne change rien mais tu crois que c'est mieux parce que t'as testé un cas facile
- C'est vraiment mieux — mais tu ne sais pas de combien
Sans mesure, tu devines. Et deviner, à l'échelle, ça ne tient pas.
Deux questions, deux métriques
Toute l'évaluation en IA se résume à deux questions :
Precision — "Quand mon agent dit oui, a-t-il raison ?"
Ton agent classifie des tickets support comme "urgents". Sur 10 tickets marqués urgents, 8 le sont vraiment.
Precision = 8/10 = 80%. Pas mal, mais 2 clients non-urgents ont été traités en priorité pour rien.
Recall — "Est-ce que mon agent trouve tous les vrais cas ?"
Il y avait en fait 12 tickets urgents. Ton agent en a trouvé 8 et raté 4.
Recall = 8/12 = 67%. Quatre clients urgents ont attendu.
Le dilemme
Tu ne peux pas maximiser les deux en même temps.
Si ton agent est ultra prudent (il marque tout comme urgent) → recall parfait, mais precision catastrophique. Tout le monde est "urgent", ça ne veut plus rien dire.
Si ton agent est ultra sélectif (il ne marque urgent que quand il est sûr à 99%) → precision parfaite, mais recall catastrophique. Il rate des vrais cas.
F1 c'est le compromis. C'est la moyenne harmonique des deux — un seul chiffre qui te dit "globalement, je suis bon ou pas".
Il n'y a pas de bon score universel
C'est le truc que personne ne te dit au début.
Un F1 de 0.75, c'est bien ou c'est nul ? Ça dépend.
Tu détectes des fraudes bancaires → rater 25% des fraudes, c'est catastrophique. Tu veux du recall très haut, quitte à avoir des faux positifs. F1 de 0.75 = insuffisant.
Tu classes des articles de blog par catégorie → une erreur de catégorie, c'est pas grave. F1 de 0.75 = largement suffisant.
Le bon score, c'est celui qui est acceptable pour ton business. Pas un chiffre magique.
Le vrai game changer
Le plus gros gain ne vient souvent pas d'un changement de modèle ou de prompt. Il vient d'un ajustement de seuil.
Ton agent dit "urgent" quand sa confiance dépasse 50%. Si tu montes le seuil à 70% → precision monte, recall baisse. Tu baisses à 30% → l'inverse.
C'est un curseur. Et sans métriques, tu ne sais même pas où il est ni dans quel sens le tourner.
En pratique : le minimum viable
Tu n'as pas besoin d'un pipeline d'évaluation complexe. Juste :
- 10-15 cas de test — tes prompts les plus fréquents avec les résultats attendus
- Un score simple — même un "nombre de cas réussis sur 15" suffit pour commencer
- Rejouer avant chaque changement — ton prompt v2 passe les 15 cas ? Tu peux push sereinement
C'est l'équivalent des tests unitaires pour tes prompts. Pas sexy, mais ça évite les régressions.
Le takeaway
ML = optimisation continue sous contraintes réelles.
Tu n'atteindras pas 95% en conditions réelles. Les données sont imparfaites, les cas edge sont partout. C'est normal.
Ce qui compte : mesurer, itérer, et optimiser pour ton contexte — pas pour un score abstrait.
Sujets abordés
- IA
- LLM
- évaluation
- métriques