Arrête de tester tes prompts à l'œil
Modifier un prompt sans le mesurer, c'est deviner. Precision, recall, F1 et seuil : les quatre notions qui transforment « ça a l'air mieux » en un chiffre.
Rubrique
Ce que les modèles changent concrètement dans un produit, et ce qu'ils ne changent pas : évaluation, observabilité, context engineering, agents.
7 articles
Modifier un prompt sans le mesurer, c'est deviner. Precision, recall, F1 et seuil : les quatre notions qui transforment « ça a l'air mieux » en un chiffre.
La fenêtre de contexte ne peut pas tout contenir. Priorité par message, budget tokens, compression extractive et nettoyage : le pipeline qui choisit quoi garder.
Luny-AI marchait, mais je n'avais aucune visibilité entre le prompt et le résultat. Ce que des traces, un coût par génération et un golden set m'auraient montré.
Raisonner, agir, observer, recommencer. Le pattern qui fait tourner LangChain, LangGraph et CrewAI, et pourquoi le LLM n'exécute jamais lui-même les actions.
Graph, Node, Edge, State : quatre mots qui font peur et qui tiennent dans une recette de cuisine. Expliqués sur une battle de rap entre Molière et Robespierre.
Une division entre l'intersection et l'union de deux ensembles. Implémentation TypeScript, fuzzy matching par n-grams, et les cas où elle ne suffit pas.
OpenRouter et Together AI : une clé unique pour tester GPT, Claude, Llama ou Mistral, un fallback automatique, et des modèles open-source à moindre coût.